GPT
V

VisualWebInstruct

קוד פתוח

TIGER-Labapache-2.02025-02-28

  • math
  • science

מאגר נרחב לאימון מודלי ראייה-שפה שמבוסס על סריקת רשת וחילוץ שאלות מורכבות. הוא מיועד למי שרוצה לשפר יכולות הסקה ופתרון בעיות בתחומי מדעים מדויקים במקום זיהוי תמונות פשוט.

  • 1,915הורדות בחודש
  • 44לייקים

מה זה

המאגר כולל כ־900 אלף זוגות של שאלות ותשובות. 40% מהם משלבים תמונות מתוך אוסף של 163,743 תמונות ייחודיות, ושאר 60% מבוססים על טקסט בלבד. רוב התוכן ממוקד במתמטיקה עם 62.5%, כשהשאר מתחלק בין פיזיקה, פיננסים, כימיה, הנדסה ותחומים נוספים.

הבנייה התבססה על כ־30 אלף תמונות מקוריות ששימשו לחיפוש בגוגל. הצוות הוריד עמודי רשת מיותר מ־700 אלף כתובות, בנה עצי נגישות כדי לשמור על מבנה התוכן, וחילץ שאלות ותשובות בעזרת מודלי שפה שעברו סינון עקביות. מקורות התמונות כוללים סריקה ישירה מהאינטרנט לצד מאגרים ידועים כמו COCO, ChartQA, AI2D ו־GeoQA+.

הנתונים מחולקים למספר תתי-מאגרים. תת-המאגר conversation מכיל שיחות מובנות שמשלבות גם את LLavaCoT, תת-המאגר visualwebinstruct מציג את השאלות והתשובות בפורמט ישיר, וקיים גם תת-מאגר דוגמאות לבדיקה מהירה.

מתאים ל

  • אימון הוראות למודלי ראייה

    שיפור ביצועי מודלי מולטימדיה במשימות שדורשות הבנת תמונה מורכבת והסקה מרובת שלבים.

  • פתרון בעיות מתמטיות עם תרשים

    אימון מודלים לניתוח גיאומטריה, גרפים ונוסחאות מדעיות שמשלבות תיאור ויזואלי וטקסט.

  • אימון מודלי שיחה מולטימדיים

    שימוש בתת-המאגר המשולב כדי ללמד מודל לנהל דיאלוג מתמשך סביב תמונות ותרשימים.

איפה זה נופל

המאגר כולו באנגלית בלבד ואינו מכיל עברית. רוב החומר נוטה בכבדות למתמטיקה ולמדעים, כך שהוא לא מתאים למשימות שיחה כלליות. בנוסף, חילוץ המידע והתשובות נעשה באמצעות מודלי שפה מתוך עמודי רשת, מה שמשאיר סיכוי להזיות או לטעויות חישוב של המודל שיצר את הדאטה, למרות שלבי הסינון שהחוקרים הפעילו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון המדווח הוא Apache 2.0, שמאפשר שימוש מסחרי חופשי. עליכם להקפיד על מתן קרדיט ושמירה על תנאי הרישיון והודעות זכויות היוצרים של היוצרים.

האם המאגר כולל תמיכה בעברית?

לא. השפה המוגדרת במאגר היא אנגלית בלבד, וכל השאלות, התשובות ועמודי הרשת שנאספו נכתבו באנגלית. שימוש בעברית ידרוש תרגום או אימון מקדים נפרד.

איך נאספו השאלות והתשובות?

החוקרים לקחו כ־30 אלף תמונות בסיס, מצאו דרך גוגל מאות אלפי עמודים שבהם הן מופיעות, וחילצו את המינהל והמבנה שלהם. לאחר מכן מודלי שפה ייצרו את זוגות השאלות והתשובות מתוך הטקסט של האתרים, והתוצאות עברו סינון עקביות.

איך מקבלים את התמונות של הדאטהסט?

התמונות לא נטענות אוטומטית דרך קריאה רגילה בספריית datasets. יש להוריד את קובץ ה־ZIP הייעודי ששמו images.zip ישירות מתוך המאגר, לחלץ אותו בדיסק המקומי ולקשר את הנתיבים לרשומות.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face בלי צורך באישור גישה. אפשר לבחור בתת-מאגר השיחות או בתת-מאגר השאלות והתשובות. הקבצים זמינים בפורמטים Parquet ו־JSONL. נקודה שחובה לקחת בחשבון בתהליך העבודה: התמונות עצמן אינן מגיעות אוטומטית עם הטעינה בקוד, וצריך להוריד ולחלץ את הקובץ images.zip בנפרד כדי לחבר אותן לשאלות.

from datasets import load_dataset

ds = load_dataset("TIGER-Lab/VisualWebInstruct")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה של הנתונים. חובה לכלול ייחוס למחברים והודעת רישיון. הרישיון אינו כופה שיתוף תחת אותו רישיון, ומודל שאומן על הנתונים אינו מחויב להיפתח כקוד פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗