GPT
D

DataCompDR-1B

קוד פתוח

appleapple-amlr2024-06-04

מעל מיליארד רשומות מועשרות עם כתוביות סינתטיות ושיקועים מחושבים מראש. אפל בנו אותו כדי לזרז אימון מודלי ראייה ושפה בלי לשרוף תקציבי עתק על חישוב מחדש.

  • 70,501הורדות בחודש
  • 35לייקים

מה זה

המאגר מבוסס על DataComp-1B בסינון BestPool, אבל הוא לא מכיל את התמונות עצמן. במקומן תמצאו מטא-דאטה שכולל קישורי URL לתמונות מקור, גיבוב SHA256, חמש כתוביות סינתטיות לכל תמונה שנוצרו במודל CoCa, ופרמטרים של אוגמנטציות חזקות.

בנוסף, כל רשומה כוללת וקטורי שיקוע מוכנים באורך 1536 ממדים. הווקטורים האלה נוצרו משרשור פלטים של שני מודלי ViT-L-14 חזקים ב־OpenCLIP על התמונות המעובדות, על הטקסט המקורי ועל הטקסטים הסינתטיים. יחידת אימון מוגדרת כאן כשלישייה של תמונה שעברה אוגמנטציה, כתובית מקורית וכתובית סינתטית שנבחרה באקראי.

מתאים ל

  • אימון מקדים חסכוני למודלי ראייה

    אימון מודלי CLIP מהיר באמצעות שימוש בשיקועים ובכתוביות הסינתטיות המוכנים מראש.

  • מחקר על אובדן ידע בזיקוק

    בדיקת שיטות זיקוק ידע ממודלים גדולים למודלים קלים באמצעות מורה כפול.

  • טיוב כתוביות למאגרי ענק

    שימוש בחמש הכתוביות החלופיות לכל תמונה לצורך מחקר על איכות תיאורי תמונה ברשת.

איפה זה נופל

הטקסט כולו באנגלית בלבד, כך שאם אתם בונים מודל לעברית או מותאם לישראל, המאגר לא יעזור לכם בלי תרגום או אימון מקדים נוסף. מעבר לזה, חלק ניכר מהקישורים המקוריים ברשת נשברים עם הזמן, מה שאומר שלא תצליחו להוריד מאה אחוז מהתמונות.

הכתוביות הסינתטיות מגיעות ממודל ראייה ושפה אוטומטי, ולכן הן כוללות בהכרח הזיות, אי דיוקים והטיות שנלמדו ממנו. אתם חייבים לקחת בחשבון שהסתמכות עיוורת על המטא-דאטה הזה בלי בדיקות איכות עלולה להכניס שגיאות תיאוריות למודל הסופי שלכם.

אותה משפחה

DataCompDR יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, המטא-דאטה שמופץ כאן מוגן ברישיון apple-amlr שמיועד בעיקרו למחקר. בנוסף, התמונות עצמן שייכות ליוצרים המקוריים ברשת ואינן מועברות ברישיון חופשי מסחרי.

האם המאגר כולל תמונות שניתן לפתוח מיד?

לא, המאגר כולל רק מטא-דאטה, כתוביות, שיקועים וקובצי קישורים. את התמונות עצמן תצטרכו להוריד באופן עצמאי מהרשת לפי הכתובות המצורפות.

האם יש תמיכה בעברית?

הנתונים מתועדים באנגלית בלבד. כתוביות המקור והכתוביות הסינתטיות שנוצרו על ידי המודל הן כולן באנגלית, ללא נתונים בעברית.

איך נאסף המידע ומה הוסיפה אפל?

הבסיס הוא סינון של DataComp-1B מתוך הרשת הפתוחה. אפל ייצרה לכל תמונה חמש כתוביות סינתטיות עם מודל CoCa, וחישבה מראש שיקועים משני מודלי ViT-L-14 שונים.

איך טוענים

הנתונים מחולקים לעשרות אלפי קובצי tar, סך הכל 65,605 קבצים במאגר, ומאורגנים לפי מזהי uid. בכל חבילה יש קובצי טקסט עם קישורים, קובצי json עם הכתוביות והאוגמנטציות, וקובצי npz שמחזיקים את השיקועים.

קחו בחשבון שכדי להשתמש בתמונות בפועל תצטרכו להוריד אותן בעצמכם מהאינטרנט לפי הקישורים, תהליך ארוך שדורש רוחב פס רציני ותשתית להורדה מקבילית. הקוד וההנחיות המלאות לטעינה נמצאים בריפוזיטורי ml-mobileclip של אפל בגיטהאב.

from datasets import load_dataset

ds = load_dataset("apple/DataCompDR-1B")

הרישיון

המטא-דאטה של אפל מופץ תחת רישיון apple-amlr, שהוא רישיון מחקרי ייעודי של החברה. הקישורים והטקסט המקורי מ־DataComp שוחררו במקור תחת CC-BY-4.0, אבל התמונות עצמן כפופות לזכויות היוצרים של בעלי האתרים שמהם הן נלקחו. השילוב הזה אומר שהשימוש במאגר מוגבל למחקר, ולא תוכלו לקחת אותו כמו שהוא ולאמן מודל מסחרי סגור בלי לבדוק לעומק את תנאי הרישיון של אפל.

הרישיון המלא ב־Hugging Face ↗