GPT
L

LLaVA-OneVision-1.5-Instruct-Data

קוד פתוח

mvp-labapache-2.02025-09-08

  • multimodal
  • vision-language-model
  • lmm
  • instruction-tuning
  • pretraining

אוסף ענק של נתוני מולטימודל שמיועד לאימון מודלי ראייה-שפה על פקודות מורכבות. הוא מאגד מעל מאה מקורות שונים של תמונות וטקסט תחת חלוקות מסודרות ומוכנות לעבודה.

  • 55,530הורדות בחודש
  • 78לייקים

מה זה

המאגר מאגד עשרות מקורות מוכרים מעולם הראייה והשפה הממוחשבת בפורמט של שיחות ותמונות. תמצאו כאן דאטהסטים של ניתוח מסמכים כמו Docmatix, שאלות ויזואליות מורכבות כמו CLEVR, חילוץ מידע מדיאגרמות, מתמטיקה גאומטרית וצילומי ממשק משתמש.

המבנה הפנימי מחולק לתצורות רבות לפי שמות המקורות המקוריים, למשל Evol-Instruct-GPT4-Turbo, FigureQA ו־Docmatix, כאשר חלק מהאוספים הגדולים פוצלו לעשרה חלקים שונים כדי להקל על הגישה. הכרטיס לא מפרט תהליכי סינון או ניקוי מיוחדים שנעשו מעבר לקיבוץ המקורות הללו לתוך סכמת נתונים אחידה של מזהה, תמונה והיסטוריית שיחה.

מתאים ל

  • אימון מודלי VLM

    כוונון עדין של מודלי ראייה-שפה למענה על שאלות מורכבות מתוך תמונות ותרשימים.

  • ניתוח מסמכים וטבלאות

    שימוש בתצורות Docmatix ודומותיה לפיתוח יכולות קריאת קבלות, חשבוניות ומסמכים סרוקים.

  • פתרון בעיות מתמטיות

    אימון מודלים להבנת שאלות גאומטריה ותרשימים מתמטיים מתוך תצורות כמו Geometry3K ו־CLEVR-Math.

איפה זה נופל

כל הנתונים המדווחים במאגר הם באנגלית בלבד. אם המוצר שלכם צריך להבין מסמכים בעברית או תמונות עם טקסט מקומי, המאגר הזה לא ייתן לכם מענה ישיר. מעבר לכך, חלק משמעותי מהמידע נוצר או עובד באמצעות מודלים מסחריים כמו GPT-4V ו־GPT-4o, מה שמכניס הטיות של מודלי שפה סינתטיים ומגבלות שימוש שנובעות מתנאי השימוש של יוצרי אותם מודלים, למרות הרישיון המוצהר בכרטיס.

שאלות
נפוצות

האם המאגר כולל נתונים בעברית?

לא. המאגר מוגדר רשמית עבור השפה האנגלית בלבד. כל הטקסטים והשיחות המצורפות לתמונות הם באנגלית.

האם מותר להשתמש בדאטהסט לאימון מודל מסחרי?

הרישיון המדווח ברמת המאגר הוא apache-2.0, שמאפשר שימוש מסחרי. עם זאת, המאגר כולל תצורות שנוצרו באמצעות מודלים כמו GPT-4o, ולכן יש לוודא שהשימוש שלכם אינו מפר את תנאי השירות של ספקי המודלים ששימשו להפקת הנתונים הללו.

האם חייבים להוריד את כל המאגר בבת אחת?

ממש לא, וגם לא מומלץ לנסות. המאגר מכיל אלפי קבצים ועשרות תצורות שונות, וניתן לטעון בכל פעם רק את התצורה הרצויה באמצעות פרמטר התצורה בספריית הנתונים.

איך טוענים

טעינת המאגר כולו בבת אחת היא מהלך כבד מאוד בגלל שמדובר ב־8,751 קבצי Parquet שמכילים נתוני תמונה מלאים. מומלץ לטעון תצורה ספציפית דרך הספרייה באמצעות ציון שם הקונפיגורציה המבוקשת, כמו Docmatix או CLEVR. המאגר פתוח לציבור ללא צורך בהרשאת גישה מיוחדת. שימו לב שבחלק מהתצורות השיחות מוגדרות עם השדות role ו־content ובאחרות עם from ו־value, כך שתצטרכו לנרמל את המבנה לפני שאתם מזינים אותו לפייפליין האימון שלכם.

from datasets import load_dataset

ds = load_dataset("mvp-lab/LLaVA-OneVision-1.5-Instruct-Data")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0, שמתיר שימוש מסחרי, שינוי והפצה ללא תשלום, בתנאי ששומרים על הצהרת זכויות היוצרים והרישיון המקורי. הרישיון אינו דורש שיתוף של הנגזרות באותו רישיון. יחד עם זאת, מכיוון שהאוסף כולל נתונים שמקורם בריצות של מודלי צד שלישי קנייניים, חובה לבדוק האם המקורות הפנימיים אינם מתנגשים עם מדיניות השימוש שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗