GPT
B

blip3-kale

קוד פתוח

Salesforceapache-2.02024-08-27

מאגר ענק של 218 מיליון זוגות תמונה וטקסט עם תיאורים צפופים ומבוססי ידע. הוא נבנה כדי לתת למודלים רב-מודאליים הבנה עמוקה של עולם התוכן בתמונה ולא רק תיוג שטחי.

  • 3,001הורדות בחודש
  • 45לייקים

מה זה

המאגר מציע 218 מיליון דוגמאות של תמונות המוצמדות לכתוביות מפורטות במיוחד באנגלית. המקור לכל התמונות הוא Datacomp-1B, מאגר רשת עצום, אך במקום להסתפק בטקסט המקורי מהאינטרנט, המפתחים יצרו כאן תיאורים שמשלבים ידע עולם אמיתי עם פירוט ויזואלי מדויק.

תהליך הבנייה התבצע בשני שלבים עיקריים. בשלב הראשון ייצרו תיאורים מפורטים לתמונות באמצעות מודל CogVLM-17B, והעשירו אותם בידע עולם בעזרת Mistral-7B Instruct v0.2. בשלב השני אימנו מודל ראייה-שפה על הנתונים המועשרים האלה, והשתמשו בו כדי לייצר כתוביות ל־118 מיליון תמונות נוספות מתוך המאגר המקורי. המאגר כולל גם את הטקסט המקורי שחולץ מתוך התמונות עצמן, כחלק מהמאמץ להציג מידע מקיף ככל האפשר על כל פריט.

מתאים ל

  • אימון מקדים רב-מודאלי

    אימון מודלי ראייה-שפה גדולים על כתוביות עשירות שדורשות הבנת הקשר רחבה.

  • יצירת כתוביות מפורטות

    כוונון מודלים למשימת תיאור תמונה צפוף המשלב עובדות ולא רק עצמים.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של כתוביות שיוצרו על ידי מודלים שונים על ביצועי הראייה.

איפה זה נופל

התמונות נלקחו ממאגר הרשת Datacomp-1B, ולכן הן יורשות את כל ההטיות המובנות באינטרנט. למרות מאמצי הסינון של הצוות, נותרו בדאטהסט ארטיפקטים שנוצרו בתהליך האוטומטי. כל הטקסט באנגלית בלבד, ואין תמיכה בעברית. בנוסף, המאגר מספק בעיקר כתוביות וטקסט מחולץ, כך שאת התמונות המקוריות עצמן תצטרכו להוריד או לאמת מול זכויות היוצרים שלהן.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

הרישיון הרשמי הוא apache-2.0 שמתיר שימוש מסחרי, אך החוקרים כתבו במפורש שהשחרור נועד למטרות מחקר בלבד. מעבר לכך, התמונות שייכות למקורות חיצוניים ברשת, ואתם אחראים לוודא זכויות יוצרים לפני אימון מודל מסחרי.

האם יש במאגר תמיכה בשפה העברית?

המאגר מוגדר ומכיל טקסט באנגלית בלבד. כל הכתוביות נוצרו באמצעות מודלים באנגלית על בסיס תמונות רשת, כך שאין בו דאטה רלוונטי לאימון מודלים בעברית.

איך נוצרו הכתוביות והידע המופיעים בו?

החוקרים שילבו שני מודלים ליצירת הכתוביות הראשוניות, CogVLM-17B לתיאור ויזואלי ו־Mistral-7B להוספת ידע עולם. לאחר מכן הם אימנו מודל ייעודי על התוצרים האלה והשתמשו בו כדי לייצר כתוביות לעוד 118 מיליון תמונות.

מה ההבדל בין המאגר הזה ל־Datacomp הרגיל?

בעוד ש־Datacomp המקורי כולל לרוב טקסט אלטרנטיבי גולמי וקצר מהרשת, כאן יש כתוביות ארוכות ומפורטות שנוצרו במיוחד. הן מתארות את הפרטים בתמונה ומשלבות עובדות חיצוניות שלא מופיעות בהכרח בטקסט המקורי.

איך טוענים

את הנתונים טוענים ישירות דרך ספריית datasets הרגילה או מורידים בקבצי parquet שמחולקים לחלקים בתיקיית data_core_set. מדובר במאגר פתוח ללא צורך בבקשת גישה מיוחדת, אך עם 174 קבצים ומאות מיליוני רשומות, צריך שטח אחסון גדול ותשתית עיבוד מקבילית חזקה כדי לקרוא את הכתוביות והמטא-דאטה ביעילות.

from datasets import load_dataset

ds = load_dataset("Salesforce/blip3-kale")

הרישיון

המאגר פורסם תחת רישיון apache-2.0, אך Salesforce מציינים בכרטיס שהוא משוחרר למטרות מחקר בלבד. האחריות על בדיקת זכויות היוצרים של התמונות המקוריות מ־Datacomp חלה במלואה על המשתמש, דבר שמסבך שימוש מסחרי ישיר במודל שמאומן עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗