GPT
V

Vero-600k

קוד פתוח

zlab-princetonapache-2.02026-02-21

  • multimodal
  • visual-reasoning
  • reinforcement-learning

מאגר נתונים רב-מודאלי מבוסס תמונות וטקסט, שמיועד במקור לאימון למידת חיזוק והסקה חזותית. הוא מספק שדות מוגדרים למודלי תגמול, מה שחוסך בניית תשתיות בדיקה מורכבות בעצמכם.

  • 28,647הורדות בחודש
  • 41לייקים

מה זה

המאגר מחולק לקונפיגורציות רבות לפי משימות שונות: תיאור תמונות, חילוץ מידע מדיאגרמות וטבלאות, ומשימות איתור, ספירה וחיפוש. הנתונים נאספו ממקורות שונים ברשת, בהם מאגרי תמונות כמו flickr30k, מאמרים מדעיים מ־arxivqa, ומאגרי ראייה ממוחשבת כמו objects365, tallyqa ו־CoSyn. חלק מהדאטה כולל הרחבות מבוססות הנחיות מנוסחות מחדש.

המבנה של כל רשומה כולל מזהה ייחודי, מקור הנתונים, תמונה, הנחיה בפורמט שיחה עם תפקיד ותוכן, והגדרה של היכולת הנבדקת. לצידם מופיע מבנה של reward_model עם תשובת אמת ואופן הבדיקה, וכן אובייקט extra_info שכולל את התחום, שאלות ותשובות, סוג התגמול וטווח סטייה מותר. רוב החלוקות מחזיקות סט אימון בגודל של אלפי עד עשרות אלפי דוגמאות לצד סט ולידציה קטן של עשרות עד מאות דוגמאות.

מתאים ל

  • אימון למידת חיזוק

    שימוש במבנה reward_model ובנתוני ground_truth לצורך אימון RL מבוסס ראייה ממוחשבת.

  • הבנת תרשימים וטבלאות

    אימון מודלי שפה רב-מודאליים על קונפיגורציות chart_ocr לחילוץ נתונים והסקה ממסמכים.

  • ספירה ואיתור אובייקטים

    שיפור יכולות Visual Grounding וספירת עצמים בתמונות באמצעות דוגמאות ממוקדות.

איפה זה נופל

כל הטקסט במאגר באנגלית בלבד, ואין בו שום תמיכה מובנית בעברית או תמונות עם טקסט מקומי. המאגר מורכב מאוסף של מקורות חיצוניים שונים, מה שאומר שיש פערי איכות, שונות בסגנון ההנחיות ורמות קושי לא אחידות בין התצורות השונות. בנוסף, מודלי תגמול שמסתמכים על ground_truth מוגדר מראש עלולים להיות קשיחים מדי בהערכת שפה חופשית, ויש לבדוק את אמינות התיוג לפני שמבצעים עליו אופטימיזציה ישירה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המדווח ברמת המאגר הוא apache-2.0, והוא מתיר שימוש מסחרי מלא. יחד עם זאת, המאגר מאגד תמונות ונתונים ממקורות קודמים כמו flickr30k ומאמרים מדעיים, ולכן מומלץ לוודא שהמקורות הספציפיים שבהם אתם משתמשים אינם מתנגשים עם המטרות שלכם.

האם הדאטהסט מתאים לעבודה בעברית?

הנתונים כולם באנגלית, כולל השאלות, התשובות והטקסט שמופיע בתמונות ובדיאגרמות. אם המטרה היא לקרוא מסמכים בעברית או לענות על שאלות חזותיות בשפה, המאגר הזה לא יספק את הדוגמאות הנדרשות.

כמה מקום המאגר דורש בדיסק?

המאגר כולו מחזיק כמעט אלף קבצים ונפח כולל של מאות ג'יגה-בייט, מכיוון שהוא מכיל את קובצי התמונות ישירות. קונפיגורציות מסוימות דורשות עשרות ג'יגה-בייט בפני עצמן, לכן מומלץ לטעון רק את התצורות שאתם צריכים לאימון.

מה מייחד את הנתונים לעומת מאגרי VQA רגילים?

המאגר בנוי ישירות עבור למידת חיזוק והסקה חזותית. במקום זוגות של תמונה ושאלה בלבד, הוא כולל שדות ייעודיים להגדרת מודל תגמול, רמת סטייה מקובלת וסוג הציון, מה שמאפשר להריץ אימוני חיזוק מובנים.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets של Hugging Face תוך ציון הקונפיגורציה הספציפית שאתם צריכים, למשל קונפיגורציות של chart_ocr או counting_grounding_search. המאגר פתוח ואינו דורש אישור גישה מראש. הנתונים מאוחסנים בקובצי Parquet, אבל בגלל שהם כוללים תמונות בפועל בתוך המאגר, נפח ההורדה הכולל של כלל התצורות כבד מאוד ומגיע למאות ג'יגה-בייט. תתמקדו רק בקונפיגורציות הרלוונטיות שלכם וחלצו את השדות image, prompt ו־reward_model.

from datasets import load_dataset

ds = load_dataset("zlab-princeton/Vero-600k")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בכפוף למתן ייחוס ושמירה על תנאי הרישיון המקוריים. מותר לאמן עליו מודלים לשימוש פנימי ומסחרי, אך יש לקחת בחשבון שחלק מהתמונות נאספו ממאגרי מקור שונים שייתכן ומחזיקים במגבלות זכויות יוצרים משלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗