GPT
L

LLaVA-OneVision-Data

קוד פתוח

lmms-labapache-2.02024-07-25

מאגר ענק לאימון מודלים מולטימודליים שמשלב מתמטיקה, הבנת מסמכים ושיחה סביב תמונות. מי שבונה מודל ראייה ושפה ימצא כאן תערובת מוכנה שמכסה היגיון ויזואלי ומענה להוראות.

  • 14,076הורדות בחודש
  • 238לייקים

מה זה

המאגר כולל 650 קבצים ומחולק לעשרות תצורות שונות לפי מקור הנתונים. כל רשומה כוללת מזהה ייחודי, מקור הנתונים, היסטוריית שיחות במבנה של שאלות ותשובות, ותמונה, למעט תצורות טקסטואליות מסוימות שבהן שדה התמונה ריק. המידע מגיע ממגוון רחב של מקורות חיצוניים כמו MathV360K, The Cauldron, סטים של OCR, אינפוגרפיקות ודיאגרמות, לצד סטים של שאלות סינתטיות שנוצרו על ידי מודלים כמו GPT-4 ו־Llama 3.

החלוקה הפנימית מפרידה בין משימות ממוקדות. תת-קבוצות מסוימות מתרכזות בפתרון בעיות גיאומטריה וגרפים, אחרות מכילות צילומי מסך מהרשת כמו VisualWebInstruct, וישנם חלקי שיחה טקסטואליים לחלוטין מבוססי Magpie שנועדו לשמר יכולות שפה כלליות. חלק מהנתונים עברו סינון מקדים על ידי היוצרים, כפי שמעידים שמות התצורות שמציינים סינון מפורש.

מתאים ל

  • אימון מודלי ראייה ושפה

    כוונון עדין של מודלי שפה להבנת תמונות, תרשימים וגרפים מורכבים באנגלית ובסינית.

  • פתרון בעיות מתמטיות ויזואליות

    שיפור היכולת של מודל לנתח דיאגרמות גיאומטריות, שאלות מדעיות וגרפיקה מדעית.

  • חילוץ מידע ממסמכים ואינפוגרפיקה

    לימוד מענה לשאלות מבוססות טבלאות, כרזות, אינפוגרפיקות וסריקות טקסט.

איפה זה נופל

המאגר תומך באנגלית ובסינית בלבד, כך שאין בו דאטה בעברית והוא לא יעזור לאימון יכולות מקומיות. יש פה תלות כבדה בדאטה סינתטי שיוצר על ידי מודלים מסחריים כמו GPT-4, מה שעלול לגרור הזיות מובנות או בעיות אמינות בניתוח תמונות מורכב. בנוסף, מדובר באוסף מקורות הטרוגני מאוד, כך שאיכות התמונות, רמת התיוג ואורך השיחות משתנים באופן קיצוני בין תצורה לתצורה, מה שמחייב ניקוי ובדיקת התאמה לפני שדוחפים אותו לתוך פייפליין של מודל פרודקשן.

שאלות
נפוצות

האם יש במאגר תמיכה בעברית?

לא. המאגר מוגדר וכולל נתונים בשפות אנגלית וסינית בלבד. אם המטרה היא אימון מודל לעיבוד תמונות עם טקסט עברי, תצטרכו להביא מקורות נתונים חיצוניים.

האם מותר להשתמש במאגר למוצר מסחרי?

המאגר מוגדר תחת רישיון Apache 2.0 שמתיר שימוש מסחרי באופן עקרוני. יחד עם זאת, חלקים נכבדים ממנו נוצרו בעזרת מודלים כמו GPT-4 Turbo, ולכן יש לוודא שהשימוש המסחרי שלכם עומד במדיניות השימוש של ספקי המודלים שמהם נוצר הדאטה.

האם חייבים להוריד את כל המאגר בבת אחת?

ממש לא, וזה גם לא מומלץ. המאגר מחולק לעשרות תצורות שונות דרך Hugging Face, וניתן להוריד רק משימות ספציפיות כמו גיאומטריה, שאלות על תרשימים או הוראות טקסט בלבד.

האם כל הדוגמאות מכילות תמונות?

לא. חלק מהתצורות, כמו אלו שנגזרו מ־Magpie או MathQA, מכילות שיחות טקסט בלבד ושדה התמונה שלהן מוגדר כריק. הן נועדו לאזן את יכולות השיחה הכלליות של המודל בזמן אימון הראייה.

איך טוענים

טוענים את המאגר דרך ספריית הנתונים של Hugging Face באמצעות ציון שם התצורה הרצויה, למשל התמקדות ב־FigureQA או באחד מקבצי השיחה. אין צורך בבקשת גישה מיוחדת, המאגר ציבורי לחלוטין. בגלל עשרות התצורות ומאות קובצי ה־parquet, מומלץ להזרים את המידע או להוריד רק את הקונפיגורציה הנדרשת ולא למשוך את כל 650 הקבצים ישירות לדיסק המקומי. השדות הקריטיים לעבודה הם conversations שמכיל את התוכן והתפקידים, ושדה ה־image שמחזיר את אובייקט התמונה.

from datasets import load_dataset

ds = load_dataset("lmms-lab/LLaVA-OneVision-Data")

הרישיון

המאגר מפורסם תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הקוד והנתונים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובת שיתוף באותו רישיון עבור מודלים שמאומנים על הנתונים, אך כיוון שחלק מהטקסטים נוצרו באמצעות מודלים של OpenAI, יש לבדוק שתנאי השימוש שלהם אינם מתנגשים עם היעד המסחרי של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗