GPT
D

DataCompDR-12M

קוד פתוח

appleapple-amlr2024-06-03

אוסף מטא-דאטה שכולל תיאורים סינתטיים ושיקועים מוכנים עבור 12.8 מיליון דוגמאות. הוא חוסך חישובי עתק באימון מודלי תמונה-טקסט יעילים באמצעות זיקוק ידע ממודלים חזקים.

  • 10,079הורדות בחודש
  • 38לייקים

מה זה

המאגר מבוסס על תת-קבוצה אחידה מתוך DataComp-1B, ומכיל מטא-דאטה מועשר עבור 12.8 מיליון רשומות. עבור כל תמונה ייצרו חמישה תיאורים סינתטיים בעזרת מודל CoCa ViT-L-14 מתוך OpenCLIP, והפעילו עליה שלושים אוגמנטציות חזקות ואקראיות.

בנוסף לטקסטים, המאגר כולל שיקועים מוכנים ברוחב 1536 ממדים, שנוצרו משרשור שני וקטורים של 768 ממדים משני מודלי ViT-L-14 שונים. כל דגימת אימון מורכבת משלשה של תמונה עם אוגמנטציה, כיתוב מקורי אחד וכיתוב סינתטי שנבחר באקראי. התמונות עצמן אינן נכללות במאגר אלא כתובות הרשת שלהן, לצד גיבובי SHA256 והפרמטרים של השינויים שבוצעו.

מתאים ל

  • אימון CLIP מהיר

    אימון מודלי ראייה ושפה מאפס בזמן קצר, כמו הגעה ל־61.7% ב־ImageNet תוך יום על שרת של 8 כרטיסי A100.

  • זיקוק ידע למובייל

    שימוש בשיקועים של המודלים הגדולים המוכנים מראש כדי לאמן מודלים קטנים וחסכוניים כמו MobileCLIP.

  • חיסכון במשאבי חישוב

    דילוג על שלב הרצת האוגמנטציות והפקת הווקטורים בזמן אמת, הודות לקובצי ה־npz המוכנים מראש.

איפה זה נופל

התמונות עצמן לא יושבות במאגר, כך שאם אתרים מקוריים נפלו או חסמו גישה, חלק מהמידע יאבד בעת ההורדה. כל הטקסטים והתיאורים הסינתטיים נוצרו באנגלית בלבד, ואין כאן תמיכה בשפות אחרות. התיאורים נוצרו על ידי מודל CoCa, ולכן כל הטיה או שגיאת זיהוי של המודל הזה הועתקה ישירות לתוך הדאטהסט. המאגר פורסם ביוני 2024, ומודלים שאומנו עליו עשויים לשקף פערי מידע או תיאורים שגויים שהיו קיימים ברשת בזמן איסוף DataComp המקורי.

אותה משפחה

DataCompDR יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המאגר כולל את קובצי התמונות עצמם?

לא, המאגר מכיל קובצי tar עם קישורי רשת לתמונות, גיבובי SHA256, כיתובים סינתטיים ושיקועים. תצטרכו להוריד את התמונות בעצמכם או להצליב נתונים מול הדאטהסט המקביל ב־Hugging Face לפי מזהי ה־UID.

האם אפשר להשתמש במאגר למוצר מסחרי?

המטא-דאטה שוחרר תחת רישיון apple-amlr המפנה למאגר ml-mobileclip של אפל, והתמונות עצמן מוגנות בזכויות יוצרים של המקור. שימוש מסחרי דורש קריאה זהירה של תנאי הרישיון של אפל ובדיקת זכויות השימוש בתמונות המקור.

האם יש במאגר נתונים בעברית?

המאגר מוגדר לשפה האנגלית בלבד. הכיתובים הסינתטיים הופקו באנגלית, וכל תהליכי האימון והוולידציה שמתוארים בו מבוססים על אנגלית.

מה ההבדל בין המאגר הזה ל־DataComp-12M הרגיל?

המאגר הרגיל מחזיק את הכיתובים והתמונות המקוריות מהרשת. הגרסה של אפל מוסיפה לכל תמונה חמישה כיתובים סינתטיים ממודל CoCa, הגדרות של שלושים אוגמנטציות ושיקועים מוכנים ממודלי ViT-L-14.

איך טוענים

הנתונים מפוצלים ל־1,028 קובצי ארכיון בפורמט tar, ללא צורך בהרשאת גישה מיוחדת להורדה. בכל ארכיון תמצאו קובצי טקסט עם כתובת התמונה, קובצי json עם הכיתובים הסינתטיים ומזהי הדגימה, וקובצי npz שמחזיקים את השיקועים. כדי להשתמש במאגר תצטרכו להוריד את התמונות המקוריות בעזרת הקישורים או לסנכרן מול המאגר המקביל mlfoundations/DataComp-12M לפי מזהי ה־UID התואמים, ולקרוא את הוראות הפריקה במאגר הגיטהאב ml-mobileclip.

from datasets import load_dataset

ds = load_dataset("apple/DataCompDR-12M")

הרישיון

המטא-דאטה מופץ תחת רישיון המחקר apple-amlr של אפל, המפנה לתנאי השימוש בפרויקט ml-mobileclip. קישורי התמונות והכיתובים המקוריים נלקחו מ־DataComp ברישיון CC-BY-4.0, אך התמונות עצמן כפופות לזכויות היוצרים של בעליהן המקוריים ברשת. הרישיון של אפל מיועד בעיקרו למחקר, ולכן חובה לבדוק את תנאי הרישיון המדויקים בגיטהאב שלהם לפני שמפתחים או מאמנים מודל שמיועד לשימוש מסחרי.

הרישיון המלא ב־Hugging Face ↗