GPT
A

ALLaVA-4V

קוד פתוח

FreedomIntelligencecc-by-nc-4.02024-01-16

  • GPT-4V
  • LVLM
  • Vision
  • Language

זהו מאגר נתונים לכוונון מודלי ראייה-שפה שמבוסס כולו על סינתזה של מודלים סגורים כמו GPT-4V. הוא מתאים למי שרוצה לאמן מודל מולטי-מודאלי על כיתובים מפורטים ושאלות נימוק בלי לאסוף תיוג אנושי יקר.

  • 2,987הורדות בחודש
  • 96לייקים

מה זה

המאגר מכיל מעל מיליון רשומות המחולקות לפי מקורות התמונה וסוג המשימה. התמונות מגיעות משני מקורות מרכזיים: LAION מהרשת הפתוחה ו־Vision FLAN. סביב תמונות אלו יצרו החוקרים תיאורים מפורטים, שאלות ותשובות שמצריכות הסבר מורכב, וכן שילבו תת-מאגר טקסטואלי טהור של 143,000 הוראות מבוססות WizardLM.

התוכן עצמו מורכב מקובצי JSON לצד קובצי ארכיון של תמונות. בסיס המאגר מסתמך על תיוג שנוצר ישירות על ידי GPT-4V באמצעות פרומפטים מובנים, ובחלקים נוספים נוספו נתונים שסונתזו על ידי מודלים כמו GPT-4o, Gemini 1.5 Pro ו־Claude 3.5 Sonnet. הכרטיס אינו מפרט הליכי סינון ידניים של פלט המודלים, אלא מתמקד בתהליך הסינתזה הישיר מהפרומפטים.

מתאים ל

  • אימון מודל ראייה-שפה

    שימוש בטקסטים המפורטים ובשאלות כדי ללמד מודל מולטי-מודאלי לנתח תמונות לעומק.

  • כוונון הוראות מעורב

    שילוב נתוני תמונה-טקסט יחד עם תת-המאגר הטקסטואלי לאימון מודל המסוגל לענות על הוראות כלליות.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של נתונים שנוצרו על ידי GPT-4V לעומת מודלים כמו קלוד וג'מיני על ביצועי המודל הסופי.

איפה זה נופל

הנתונים מוגבלים לשפה האנגלית בלבד, ואין כאן ייצוג לעברית. כל התיאורים והתשובות מיוצרים על ידי מודלי שפה מסחריים, מה שגורר הזיות מובנות, פטפטנות יתר והטיות שמגיעות ישירות מ־GPT-4V ומשאר המודלים ששימשו לייצור. בנוסף, התמונות שמקורן ב־LAION נאספו מהרשת הפתוחה, כך שאיכותן אינה אחידה והן עלולות להכיל תכנים בעייתיים. החוקרים לא מציינים תהליך סינון אנושי שמוודא את דיוק התשובות ביחס לתמונות בפועל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-4.0, מה שאוסר שימוש מסחרי באופן ישיר. מעבר לכך, הנתונים סונתזו באמצעות מודלים כמו GPT-4V, שתנאי השימוש שלהם אוסרים שימוש בפלט לאימון מודלים מסחריים מתחרים.

האם יש במאגר תמיכה בעברית?

לא, המאגר כולו באנגלית. כל השאלות, התשובות והכיתובים נוצרו באנגלית, ואין בו ייצוג לטקסט מקומי או תרבותי בעברית.

איך נאספו התמונות והטקסטים?

התמונות הגיעו ממאגרי LAION ו־Vision FLAN. הטקסטים לא נכתבו על ידי בני אדם, אלא נוצרו על ידי הרצת פרומפטים דרך GPT-4V, ובחלק קטן דרך GPT-4o, Gemini ו־Claude.

האם מקבלים את התמונות ישירות או רק קישורים?

התמונות זמינות להורדה ישירה מתוך המאגר בקובצי ZIP מפוצלים. החוקרים צירפו אותן כדי למנוע קישורים שבורים ברשת, אם כי הם מדגישים שאין להם זכויות יוצרים על התמונות עצמן.

איך טוענים

הנתונים יושבים בקובצי JSON עבור הטקסט ובקובצי ZIP מפוצלים עבור התמונות, לדוגמה images_0.zip עד images_4.zip בתיקיית LAION. המאגר ציבורי ואינו דורש אישור גישה מראש. כדי לעבוד איתו נדרש לשבט את מאגר הגיטהאב שלהם ולהריץ סקריפטים של Bash שמורידים ומחלצים את התמונות לתיקיות ייעודיות לפי המקורות השונים. השדות העיקריים ב־JSON כוללים את זיהוי התמונה, ההוראה או השאלה, והתשובה המפורטת שנוצרה.

from datasets import load_dataset

ds = load_dataset("FreedomIntelligence/ALLaVA-4V")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0 שמיועד לשימוש לא-מסחרי בלבד ומחייב מתן קרדיט. מודל שתאמנו על הנתונים הללו לא יוכל לשמש במוצר מסחרי. בנוסף, החוקרים מצהירים מפורשות שאין להם זכויות על התמונות עצמן, והסתמכות על פלטים של מודלי OpenAI לייצור דאטה כפופה לתנאי השימוש שלהם.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗