GPT
L

LLaVA-Pretrain

קוד פתוח

liuhaotianother2023-05-02

חבילת נתונים של תמונות ותיאורים שנועדה לחבר בין מודל שפה למודל ראייה בשלב האימון המקדים. תקבלו פה שיחות סינתטיות פשוטות שמלמדות את המודל לתאר תמונות באנגלית.

  • 4,037הורדות בחודש
  • 225לייקים

מה זה

המאגר כולל תת קבוצה מתוך שילוב המאגרים LAION, Conceptual Captions ו־SBU, שעברה סינון במטרה להגיע לכיסוי מושגים מאוזן יותר. הרשומות מורכבות מזוגות של תמונה וטקסט שהומרו למבנה של שיחה. המפתחים לקחו את תיאור התמונה המקורי מ־CC-3M כתשובה, והצמידו לו הוראות שנוצרו אקראית, כמו הבקשה לתאר את מה שרואים בתמונה.

בפנים יש שלושה קבצים עיקריים. הקובץ blip_laion_cc_sbu_558k.json מכיל את השיחות הסינתטיות עצמן לאימון. הקובץ blip_laion_cc_sbu_558k_meta.json מחזיק את המטא דאטה עם שמות הקבצים, כתובות המקור ברשת ותיאורים סינתטיים שנוצרו עם מודל BLIP. לצדם תמצאו את images.zip שמחזיק את התמונות הגולמיות שסוננו.

מתאים ל

  • אימון מקדים למודל ראייה

    חיבור ויישור ראשוני בין רכיב הראייה לרכיב השפה במודלים מולטימודליים.

  • שחזור מחקר של LLaVA

    הרצה מקומית של שלב ה־pretraining לפי הנייר המקורי של הפרויקט.

  • בדיקת תיאורי תמונות סינתטיים

    השוואה בין כיתוב התמונה המקורי מ־CC-3M לבין הכיתוב שנוצר על ידי BLIP.

איפה זה נופל

הטקסט כולו באנגלית בלבד, כך שאין כאן שום מענה למשימות בעברית ללא תרגום או התאמה. הנתונים מתבססים על סריקות רשת ישנות ומודלים סינתטיים ממאי 2023, וחלק מקישורי המקור המקוריים כבר נעלמו מהרשת. בנוסף, מדובר בהוראות בסיסיות מאוד כמו תיאור תמונה, ולא בהסברים מורכבים או ניתוח מעמיק.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הכרטיס מציין במפורש שקובץ התמונות מיועד לצורכי מחקר בלבד ולא לשום מטרה אחרת. בנוסף יש לעמוד ברישיונות המקוריים של LAION, CC-3M ו־BLIP, כך שהוא אינו מתאים למוצר מסחרי סגור.

האם יש במאגר תמיכה בעברית?

לא. כל התיאורים, ההוראות והמטא דאטה מוגדרים באנגלית בלבד. אם המטרה היא מודל שמבין עברית, תצטרכו לתרגם את הטקסטים בעצמכם או להשתמש במקור אחר.

למה התמונות מצורפות בקובץ zip ולא כקישורים?

המפתחים ארזו את התמונות ב־images.zip מפני שכ־15% מהקישורים במאגרי המקור המקוריים כבר לא היו זמינים ברשת. הקובץ הועלה כדי לאפשר לחוקרים לשחזר את העבודה גם כשהאתרים המקוריים נעלמו.

איך נוצר הטקסט של השיחות במאגר?

החוקרים לקחו את תיאור התמונה הקיים מ־CC-3M והפכו אותו לתשובה. לשם כך הם הוסיפו לפניו הוראה פשוטה שנבחרה אקראית, לדוגמה הבקשה לתאר את התמונה המוצגת.

איך טוענים

אין כאן שער גישה שדורש אישור מיוחד, מורידים את הקבצים ישירות מהמאגר. העבודה דורשת פריסה של ארכיון images.zip וטעינה של קובצי ה־JSON שמקשרים בין שם קובץ התמונה לטקסט השיחה. השדות המרכזיים ב־JSON מכילים את ההוראה ואת התשובה, ובקובץ המטא דאטה תמצאו את ה־URL המקורי ואת הכיתוב מ־BLIP.

from datasets import load_dataset

ds = load_dataset("liuhaotian/LLaVA-Pretrain")

הרישיון

הרישיון מסומן כ־other והוא מורכב מכמה תנאים במקביל. היוצרים מציינים שקובץ התמונות הועלה לצורכי מחקר ושחזור מדעי בלבד, ואינו מיועד לשום מטרה אחרת. שימוש בנתונים דורש עמידה ברישיונות של CC-3M ושל BLIP, כאשר תמונות עלולות להימחק אם בעלי הזכויות המקוריים ידרשו זאת. עבור מוצר מסחרי, זהו סיכון משפטי ברור.

הרישיון המלא ב־Hugging Face ↗