GPT
D

datacomp_pools

קוד פתוח

mlfoundationscc-by-4.02023-02-01

המאגר כולל קובצי מטא-דאטה של צמדי תמונה וטקסט לאימון מודלים רב-מודאליים. הוא מיועד למי שרוצה לסנן בעצמו דאטה בנפח עצום במקום להוריד תמונות עיוור.

  • 67,911הורדות בחודש
  • 19לייקים

מה זה

המאגר מכיל קובצי מטא-דאטה שמרכזים קישורים לתמונות וטקסטים נלווים, כחלק מפרויקט DataComp. הרשומות עצמן לא כוללות את קובצי התמונה, אלא מצביעות על מקורות ברשת ועל הטקסטים שהופיעו לצדן. המבנה מחולק לעשרות אלפי קובצי Parquet, בין היתר תחת תיקיית datacomp_1b שמרמזת על היקף של מיליארד דגימות, ללא פירוט נוסף בכרטיס על אופן החלוקה הפנימי.

היוצרים לא פירטו בכרטיס מהיכן בדיוק גורדו הנתונים ברשת ואיזה סינון ראשוני בוצע לפני יצירת האינדקס, אלא הפנו לקוד ולאתר החיצוני שלהם. הדגימות נמסרות כאינדקס גולמי יחסית, במטרה לאפשר לחוקרים לבחון שיטות סינון ואימון שונות על גבי אותם מקורות בדיוק.

מתאים ל

  • סינון דאטה לאימון מודלים

    פיתוח אלגוריתמים לבחירת צמדי תמונה וטקסט איכותיים מתוך מאגר גדול.

  • אימון מודלים מולטי-מודאליים

    משיכת התמונות לפי הקישורים לצורך אימון מודלי ראייה ושפה רחבי היקף.

  • מחקר על דגימת נתונים

    השוואת ביצועי מודלים שאומנו על תתי-קבוצות שונות מתוך המאגר.

איפה זה נופל

הבעיה המרכזית היא שאין כאן תמונות אלא רק כתובות רשת, כך שקישורים רבים עלולים להישבר עם הזמן. בנוסף, הכרטיס לא מפרט אילו שפות קיימות בטקסטים, מתי נאספו הנתונים, או אילו הטיות ותכנים בעייתיים קיימים בהם. היוצרים מציינים במפורש שהשימוש הוא על אחריות המוריד בלבד, מה שמחייב בדיקה משפטית וסינון עצמאי לפני אימון מודל יישומי.

שאלות
נפוצות

האם המאגר כולל תמונות מוכנות להורדה?

לא. המאגר מכיל רק קובצי מטא-דאטה עם קישורים לתמונות וטקסטים נלווים בפורמט Parquet. את התמונות עצמן תצטרכו להוריד באופן עצמאי מהשרתים המקוריים.

האם מותר להשתמש בו לפרויקט מסחרי?

קובצי המטא-דאטה זמינים תחת רישיון cc-by-4.0 שמתיר שימוש מסחרי עם ייחוס. יחד עם זאת, התמונות שברשת כפופות לזכויות היוצרים המקוריות שלהן, והיוצרים מטילים את האחריות המשפטית על מי שמוריד אותן.

האם יש במאגר תמיכה בעברית?

כרטיס המאגר לא מפרט אילו שפות נכללות בטקסטים או מה החלוקה ביניהן. אם אתם בונים מודל ייעודי לעברית, תצטרכו לדגום את קובצי ה־Parquet ולבדוק את תכולת הטקסט בעצמכם.

איך אפשר לדעת כיצד הנתונים סוננו ונאספו?

הכרטיס הנוכחי לא כולל הסבר על תהליך האיסוף או הסינון. המפרסמים מפנים ישירות לאתר הרשמי של DataComp ולעמוד ה־GitHub שלהם כדי לראות את הקוד והתיעוד המלא.

איך טוענים

המאגר פתוח להורדה ישירה ללא צורך בהרשאה מיוחדת, ומכיל 55,993 קבצים, רובם בפורמט Parquet. כדי להשתמש בו צריך כוח מחשוב שיודע לעבד עשרות אלפי קבצים במקביל, ולהריץ תהליך הורדה נפרד שימשוך את התמונות עצמן מתוך הקישורים שבמטא-דאטה. הכרטיס לא מציין את הנפח המדויק בדיסק או את שמות העמודות, ומפנה ל־GitHub של הפרויקט לצורך מימוש הטעינה.

from datasets import load_dataset

ds = load_dataset("mlfoundations/datacomp_pools")

הרישיון

המטא-דאטה, הקישורים והטקסטים מופצים תחת רישיון cc-by-4.0, שמתיר שימוש מסחרי ומחקר כל עוד נותנים ייחוס מתאים ליוצרים. עם זאת, התמונות עצמן כפופות לזכויות היוצרים של האתרים שמהם הן נמשכות. מודל שאומן על המידע דורש בחינה של זכויות היוצרים של התמונות בפועל, ולא רק של קובצי המטא-דאטה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗