GPT
L

LLaVA-OneVision-1.5-Mid-Training-85M

קוד פתוח

mvp-labapache-2.02025-09-14

אוסף ענק של 85 מיליון דוגמאות שנועד לשלב אמצע האימון של מודלי ראייה ושפה. הוא מרכז מקורות ויזואליים מוכרים כדי לחבר בין טקסט לתמונה בהיקף רחב.

  • 825,971הורדות בחודש
  • 95לייקים

מה זה

המאגר מיועד לשלב הביניים באימון מודלים מולטימודליים, והוא מחולק לפי מקורות המידע שמהם נדגמו הנתונים. המפרסמים מציינים שהועלו אליו שמונה מקורות שונים: ImageNet-21k, LAIONCN, DataComp-1B, Zero250M, COYO700M, SA-1B, MINT וכן Obelics. כל אחד מהמקורות האלה מביא איתו אופי שונה של דאטה, מחלוקות מקוונות של תמונה וטקסט כמו קויו ודאטה-קומפ ועד נתוני סגמנטציה כמו אס-איי 1B ומסמכים רב-מודליים כמו אובליקס.

מבנה הקבצים במאגר מציג חלוקה לתיקיות לפי מקור המקורות ולפי שפה, כאשר קבצי הנתונים עצמם שמורים בפורמט פרקט. לדוגמה, קיימת חלוקה פנימית ייעודית לאנגלית תחת קויו שמפוצלת לעשרות קבצים נפרדים. הכרטיס המקורי לא מפרט תהליכי סינון, ניקוי או הסרת כפילויות שנעשו על הנתונים הגולמיים, ומסתפק בציון שמות המאגרים שהועלו במלואם.

מתאים ל

  • אימון ביניים למודלי ראייה

    חיבור ייצוגים חזותיים לטקסטואליים בהיקף גדול על בסיס מגוון מקורות רשת.

  • סינון והתאמת דאטה

    דגימת תתי קבוצות ספציפיות מקויו או אובליקס לטובת משימות ממוקדות.

  • שחזור מחקר והשוואת בנצ'מרק

    שימוש בתשתית הפתוחה כדי לשחזר את שלבי האימון של הפרויקט המקורי.

איפה זה נופל

התיעוד בעמוד כמעט לא קיים ומלבד רשימת המקורות אין שום מידע על מבנה השדות הפנימי, סוגי ההטיות או אופן עיבוד הטקסט. הנתונים מתבססים בחלקם על סריקות רשת ענקיות שידועות ברעש רב, וקיימת התמקדות באנגלית ובסינית לפי שמות התיקיות והמקורות. אין כאן שום אזכור לתמיכה בעברית, ולכן לא כדאי להסתמך עליו ליכולות שפה מקומיות לפני שדוגמים ובודקים את התוכן ידנית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון של המאגר עצמו הוא אפאצ'י 2.0, שמתיר שימוש מסחרי ללא דרישה לשיתוף קוד המודל. עם זאת, המאגר מורכב משמונה מקורות שונים שחלקם נסרקו מהרשת, ולכן כדאי לוודא שהשימוש שלכם תואם לזכויות היוצרים של התמונות המקוריות.

האם הדאטהסט מכיל עברית?

הכרטיס לא מדווח על תמיכה בעברית. המקורות המפורטים כוללים תיקיות באנגלית ומאגרים בסינית, כך שסביר להניח שאין כאן ייצוג משמעותי לעברית.

כמה שוקל הדאטהסט ואיך מתמודדים איתו?

המאגר כולל 12,126 קבצים, כך שמדובר בנפח אחסון כבד מאוד שלא מתאים לעבודה על מחשב אישי רגיל. מומלץ להוריד רק את התיקיות של המקורות הרלוונטיים עבורכם במקום לסנכרן את כל המאגר.

מה ההבדל בין המאגר הזה לדאטהסטים אחרים?

הייחוד כאן הוא איגוד מגוון מקורות עצום לשלב הביניים של אימון מולטימודלי במקום אחד. במקום להוריד ולעבד בנפרד מקורות כמו קויו, אימג'נט או דאטה-קומפ, הם מרוכזים יחד בפורמט פרקט אחיד.

איך טוענים

המאגר מכיל 12,126 קבצים, בעיקר בפורמט פרקט, והוא פתוח להורדה ישירה בלי צורך בבקשת גישה מיוחדת. בגלל שמדובר באלפי קבצים שמפוצלים לפי מקורות ושפות, מומלץ לא למשוך את כולו בבת אחת אלא לטעון ספציפית את החלקים הרלוונטיים באמצעות ספריית הדאטהסטס או ישירות בקריאת פרקט לפי הנתיב הנדרש. שמות העמודות המדויקים בתוך הטבלאות לא מתועדים בעמוד הראשי.

from datasets import load_dataset

ds = load_dataset("mvp-lab/LLaVA-OneVision-1.5-Mid-Training-85M")

הרישיון

המאגר מפורסם תחת רישיון אפאצ'י 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב אתכם לשחרר את המודלים שתאמנו תחת אותו רישיון. החובה העיקרית היא מתן קרדיט ושמירה על תנאי הרישיון והודעות זכויות היוצרים המקוריות של הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗