GPT
L

LLaVA-CC3M-Pretrain-595K

קוד פתוח

liuhaotianother2023-04-20

המאגר מרכז 595 אלף תמונות ותיאורים מסוננים מתוך CC-3M ליישור תכונות במודלי ראייה-שפה. הוא מתאים למי שבונה שלב אימון מקדים למודל מולטימודלי ולא רוצה להוריד קישורים שבורים מהרשת.

  • 494הורדות בחודש
  • 180לייקים

מה זה

המאגר כולל תת-קבוצה מסוננת מתוך Conceptual Captions של גוגל, שנבחרה כדי לייצר פיזור מאוזן יותר של מושגים. המטרה שלו היא שלב האימון המקדים של LLaVA, שנועד לחבר בין מאפייני התמונה למרחב השפתי של מודל השפה. כל רשומה מורכבת מתמונה וזוג של שאלה ותשובה פשוטים, שנוצרו מהוספת הוראה אקראית כמו בקשה לתאר את התמונה יחד עם התיאור המקורי.

התוכן מחולק לקובץ chat.json שכולל את השיחות הסינתטיות האלה, וקובץ metadata.json שמכיל את נתוני המקור: אינדקס התמונה, שם הקובץ, הקישור המקורי, התיאור מ־CC-3M וכיתוב סינתטי נוסף שנוצר באמצעות BLIP. בערך 10 אחוזים מהרשומות עדיין חסרות את הכיתוב של BLIP בגרסה הזו. בנוסף מצורף קובץ images.zip שמכיל את כל התמונות הגולמיות עצמן.

היוצרים החליטו לארוז את התמונות ישירות במאגר בגלל שבערך 15 אחוזים מהתמונות המקוריות של CC-3M כבר לא היו נגישות ברשת בעת הפרסום באפריל 2023. הסינון והעיבוד התבססו על שילוב הטקסטים המקוריים עם מודל הראייה כדי להבטיח התאמה טובה יותר בין הטקסט למה שמופיע בתמונה בפועל.

מתאים ל

  • אימון מקדים ליישור ראייה

    חיבור ראשוני בין מודל ראייה למודל שפה בעזרת תיאורי תמונות פשוטים.

  • הערכת כיתוב סינתטי

    השוואה בין התיאור המקורי של גוגל לבין הכיתוב שנוצר על ידי BLIP.

  • שחזור תוצאות LLaVA

    אימון מודל בתנאים זהים לניסוי המקורי שפורסם באפריל 2023.

איפה זה נופל

הנתונים כולם באנגלית בלבד ואין כאן אף מילה בעברית. הטקסטים בסיסיים מאוד ומורכבים ממשפטים קצרים או כותרות, כך שהם לא מכינים מודל לשיחות מורכבות או להבנת הקשר עמוק. בנוסף, קובץ התמונות הועלה בגלל קישורים שבורים, והיוצרים מציינים במפורש שהוא עלול לרדת מהרשת אם בעלי הזכויות המקוריים ידרשו זאת. כעשירית מהדוגמאות מגיעות בלי כיתוב ה־BLIP הסינתטי.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר מבוסס על CC-3M ו־BLIP וכולל טקסטים באנגלית בלבד. אם אתם מכוונים למודל שמבין עברית, תצטרכו לתרגם את הנתונים או להוסיף מקורות מקומיים.

מותר להשתמש בזה למוצר מסחרי?

הרישיון של CC-3M מתיר שימוש חופשי לכל מטרה, אך היוצרים ציינו שקובץ התמונות הועלה למטרות מחקר בלבד עקב זכויות יוצרים וקישורים שנמחקו מהרשת. בנוסף, שימוש בכיתובי BLIP כפוף לרישיון הנפרד שלהם, כך שיש סיכון משפטי סביב החזקת התמונות עצמן.

איך בנו את השיחות בקובץ chat.json?

החוקרים לקחו את תיאור התמונה מתוך CC-3M וחיברו אליו הוראה אקראית מתוך רשימה קבועה, כמו בקשה לתאר את מה שרואים. התיאור המקורי הוגדר כתשובה של המערכת, כדי לייצר מבנה בסיסי של שיחה.

למה התמונות מצורפות כקובץ זיפ במקום קישורים בלבד?

כ־15 אחוזים מהקישורים המקוריים ב־CC-3M כבר לא היו זמינים ברשת בזמן איסוף הדאטהסט. כדי שהקהילה תוכל לשחזר את הניסוי בלי לאבד דוגמאות בגלל שגיאות רשת, החוקרים ארזו והעלו את כל התמונות ישירות.

איך טוענים

אין צורך לבקש אישור גישה מיוחד כדי להוריד את הקבצים. אתם מורידים ישירות את images.zip ומחלצים את התמונות, יחד עם chat.json ו־metadata.json. השדות החשובים לעבודה הם התמונה עצמה, ההוראה שנוצרה בתוך קובץ השיחה, והכיתוב המקורי של CC-3M שמשמש כתשובה. אם אתם רוצים להשתמש בתיאורים של BLIP, תמצאו אותם במטא-דאטה.

from datasets import load_dataset

ds = load_dataset("liuhaotian/LLaVA-CC3M-Pretrain-595K")

הרישיון

הרישיון מוגדר במאגר כ־other, כי הוא תלוי בשני מקורות שונים. הנתונים מ־CC-3M מותרים לשימוש חופשי לכל מטרה, וגוגל רק מבקשת ייחוס כמקור למידע. עם זאת, היוצרים מציינים שקובץ התמונות נועד למחקר בלבד כדי לשחזר את העבודה, וחלים עליו גם תנאי הרישיון של BLIP אם אתם בוחרים להשתמש בכיתובים הסינתטיים שלהם.

הרישיון המלא ב־Hugging Face ↗