GPT
D

datacomp_xlarge

קוד פתוח

mlfoundationscc-by-4.02023-05-22

מאגר מטא-דטה בהיקף ענק שנועד לאימון והערכה של מודלי שפה ותמונה. פונים אליו כשרוצים לחקור סינון נתונים ובניית מאגרים בסדרי גודל עצומים.

  • 25,827הורדות בחודש
  • 20לייקים

מה זה

המאגר כולל מטא-דטה של צמדי קישורי תמונות וטקסטים מלווים, כחלק מפרויקט DataComp בקנה מידה של xlarge. הנתונים עצמם אינם מכילים את קובצי התמונות המקוריים, אלא אינדקס מסודר של כתובות רשת והטקסטים שנאספו איתן, לצד מאפיינים שנועדו לחקירת איכות הדאטה.

בפועל, המבנה מחולק לעשרות אלפי קבצים בספריות כמו part_0, שמופיעים בפורמטים של parquet ו־npz. קובצי ה־parquet שומרים את רשומות המטא-דטה והקישורים, וקובצי ה־npz מכילים אמבדינגס או ייצוגים נומריים של הדגימות. כרטיס המאגר לא מפרט מאיזה אתרים ספציפיים נאספו הקישורים, איך בדיוק בוצע הסינון הראשוני או מה ההתפלגות התמטית של הטקסטים.

המטרה המוצהרת של הפרויקט היא לשמש כר פתוח למחקר על בחירת נתונים. החלוקה לחלקים מרובים מאפשרת לעבד ולסנן מקטעים בצורה מבוזרת, בלי לחייב טעינה של כל הרשומות לזיכרון בבת אחת.

מתאים ל

  • מחקר על סינון דאטה

    בדיקת אלגוריתמים לסינון ודגימת נתונים מתוך מאגר קישורים ענק לפני אימון.

  • אימון מודלי מולטימודל

    הורדת התמונות ואימון מודלים משולבי ראייה ושפה על בסיס הטקסטים המצורפים.

  • ניתוח אמבדינגס

    שימוש בקובצי ה־npz הקיימים כדי לנתח ייצוגים וקטוריים של דגימות בקנה מידה גדול.

איפה זה נופל

הכרטיס לא מפרט אילו שפות קיימות בטקסטים, מתי הקישורים נאספו או איזה סינון של תוכן פוגעני נעשה. החיסרון המרכזי הוא שמדובר בקישורים בלבד, וחלק מהתמונות המקוריות כבר נעלמו מהרשת או שינו כתובת מאז הפרסום במאי 2023. מעבר לזה, התמונות עצמן מוגנות בזכויות יוצרים של היוצרים שלהן ולא נבדקו משפטית על ידי מפרסמי המאגר. אם אתם בונים מוצר מסחרי, תצטרכו לסנן ולהוריד את המדיה בעצמכם ולוודא שהתכנים מתאימים לשימוש שלכם.

שאלות
נפוצות

האם המאגר כולל את קובצי התמונות?

לא. המאגר מכיל רק קובצי מטא-דטה עם כתובות אינטרנט של תמונות והטקסטים שלהן. אם אתם רוצים את התמונות, תצטרכו להוריד אותן בעצמכם מכתובות הרשת המקוריות.

מותר להשתמש בזה לפיתוח מסחרי?

האינדקס והמטא-דטה עצמם זמינים תחת cc-by-4.0 ומותרים לשימוש כזה עם מתן קרדיט. עם זאת, התמונות שתורידו מהרשת כפופות לזכויות יוצרים נפרדות, והיוצרים מבהירים שהשימוש בהן הוא על אחריותכם בלבד.

האם יש במאגר טקסטים בעברית?

כרטיס המאגר לא מפרט את השפות הקיימות בטקסטים או את התפלגותן. סביר להניח שרוב הטקסטים באנגלית, וצריך לבדוק מדגם של קובצי parquet כדי לדעת אם יש ייצוג כלשהו לעברית.

כמה קבצים יש במאגר ואיך הם מאורגנים?

יש במאגר 47,750 קבצים שמחולקים לתיקיות משנה. הם מופיעים בצמדים של parquet עבור רשומות הטקסט והקישורים, ו־npz עבור ייצוגים נומריים.

איך טוענים

לא צריך לבקש אישור גישה מיוחד כדי להוריד את הקבצים. הטעינה נעשית דרך כלי העבודה של DataComp או ישירות על קובצי ה־parquet וה־npz שיושבים בספריות. יש כאן 47,750 קבצים, כך שמומלץ לבנות תהליך עבודה שמוריד ומעבד כל קובץ בנפרד במקום לנסות למשוך הכל יחד. השדות הקריטיים הם קישורי התמונות והטקסט המצורף, אבל כדי לעבוד איתם באמת תצטרכו להריץ תהליך חיצוני שיוריד את התמונות עצמן מהרשת.

from datasets import load_dataset

ds = load_dataset("mlfoundations/datacomp_xlarge")

הרישיון

המטא-דטה והאינדקס מופצים תחת רישיון cc-by-4.0, שמאפשר שימוש מסחרי ומחקר בתנאי שאתם נותנים קרדיט ליוצרים. הרישיון הזה לא מכסה את התמונות עצמן. כל תמונה ברשת כפופה לזכויות היוצרים ולתנאי השימוש של האתר שממנו היא יורדת, והאחריות המשפטית על הורדה ושימוש בהן חלה עליכם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗