GPT
S

ShareGPT4V

קוד פתוח

Lin-Chencc-by-nc-4.02023-11-20

מאגר כתוביות מפורטות לתמונות שנוצר באמצעות GPT-4 Vision ומודל ייעודי שאומן עליו. הוא נבנה כדי לאמן מודלים רב-מודאליים להבין פרטים ויזואליים קטנים יותר ממה שמודלים פתוחים מציעים בדרך כלל.

  • 1,946הורדות בחודש
  • 316לייקים

מה זה

המאגר מכיל מעל מיליון רשומות שמחולקות לכמה קבצי JSON מרכזיים לפי שלבי האימון. הקובץ המרכזי לקדם-אימון כולל כ־1.24 מיליון תיאורים שנוצרו על ידי Share-Captioner, מודל כתוביות שהחוקרים אימנו בעצמם על בסיס דאטה סינתטי, והוא מתבסס על תמונות ממאגרי COCO, SAM ו־LCS.

חלק נוסף במאגר כולל 100 אלף רשומות של הוראות ותיאורים שנוצרו ישירות דרך GPT-4 Vision, שנאספו בתחילת נובמבר 2023. לצדם ישנו קובץ מעורב של 665 אלף דוגמאות שמיועד לשלב ה־SFT, ומשלב כתוביות שנבחרו וסוננו מתוך אותן 100 אלף דוגמאות יחד עם חיתוכים ממאגרים שונים.

מתאים ל

  • קדם-אימון רב-מודאלי

    חיבור ויישור בין מודל שפה למקודד תמונה בעזרת כתוביות מפורטות על תמונות מ־COCO ו־SAM.

  • אימון הוראות ויזואלי

    שימוש בקובץ ה־SFT כדי ללמד מודל לענות על שאלות מורכבות ולזהות פרטים ספציפיים בתמונות.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של כתוביות שנוצרו על ידי מודלים סגורים מול כתוביות אנושיות מסורתיות.

איפה זה נופל

הטקסט כולו באנגלית בלבד ואין בו שום תמיכה בעברית. הנתונים נאספו בנקודת זמן ספציפית בנובמבר 2023, והם מבוססים על פלטים סינתטיים של GPT-4 Vision או של מודל שחוקה ממנו, כך שכל הזיה או הטיה של המודל המקורי עברה פנימה ישירות לטקסט.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא לשימוש לא מסחרי בלבד, ובנוסף הדאטה מבוסס על פלטים של OpenAI שכפופים לתנאי השימוש שלהם. כל מודל שמאומן עליו מוגבל למחקר.

האם המאגר כולל תמיכה בעברית?

לא, כל הכתוביות וההוראות בדאטהסט נוצרו ונאספו באנגלית בלבד. אם המטרה היא אימון בעברית תצטרכו לתרגם את הטקסטים בעצמכם.

מאיפה הגיעו התמונות עצמן?

הכתוביות מבוססות על מאגרי תמונות פתוחים מוכרים, בעיקר COCO, SAM ו־LCS. קבצי ה־JSON במאגר מחזיקים את הטקסטים והמזהים שמתאימים לתמונות האלה.

איך טוענים

הדאטה מגיע בצורת קבצי JSON סטנדרטיים שיושבים ישירות במאגר, ללא צורך בהרשאת גישה מיוחדת. כדי להשתמש בו בפועל תצטרכו להוריד את קובץ המטא-דאטה הרלוונטי לשלב שלכם, כמו קובץ ה־100k לחידוד או קובץ ה־1.2M לאימון רחב, ולוודא שיש לכם גישה לתמונות המקור שהכתוביות מתייחסות אליהן.

from datasets import load_dataset

ds = load_dataset("Lin-Chen/ShareGPT4V")

הרישיון

הרישיון הוא CC-BY-NC 4.0, מה שאוסר שימוש מסחרי מכל סוג. בנוסף החומר כפוף לתנאי השימוש של OpenAI לגבי יצירת מודלים מתחרים. מודל שתאמנו על הדאטהסט הזה מוגבל למחקר ולניסויים בלבד, ולא תוכלו לשלב אותו במוצר מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗