GPT
D

datacomp_1b

קוד פתוח

mlfoundationscc-by-4.02023-06-11

מאגר מטא-דאטה עצום שנועד לאימון מודלי ראייה ושפה בהיקף רחב. הוא מספק קישורים וטקסטים למי שבונה מערכות מולטי-מודאליות ורוצה גמישות בסינון המקורות.

  • 6,993הורדות בחודש
  • 51לייקים

מה זה

המאגר כולל אינדקס של קבצי מטא-דאטה עם צמדי קישורים לתמונות וטקסטים שנאספו מרחבי הרשת. במקום להוריד תמונות מוכנות מראש, מקבלים כאן רשימות כתובות שמהן צריך למשוך את התוכן עצמו. החלוקה הפנימית מורכבת מ־5,330 קבצים בפורמטים של parquet לצד קבצי npz משלימים, כאשר שמות הקבצים מייצגים מזהים ייחודיים של מקטעי המידע.

הכרטיס הרשמי מפנה לאתר הפרויקט ולמאגר הקוד בגיטהאב לצורך פירוט על אופן השימוש במטא-דאטה, ולא מפרט בגוף הטקסט עצמו את שלבי הסינון המדויקים שנעשו במקור. בפועל אתם מקבלים את רשימת המקורות כפי שהיא, ללא עיבוד מוקדם של הפיקסלים, וכל תהליך בניית הדאטהסט המלא מתבסס על משיכת המידע מהאינטרנט לפי המפתחות האלה.

מתאים ל

  • אימון מודלי שפה ותמונה

    אימון מודלים משולבים של טקסט ותמונה בקנה מידה גדול על בסיס הקישורים והטקסטים שנאספו.

  • מחקר על סינון נתונים

    בדיקת שיטות שונות לסינון והשבחת מטא-דאטה לפני שלב הורדת התמונות ואימון המודלים.

  • הערכת ביצועי מודלים

    בחינת יכולות של מודלי ראייה ממוחשבת מול כמויות גדולות של תיאורי תמונה מגוונים.

איפה זה נופל

אין כאן תמונות אלא קישורים בלבד, וזה אומר שחלק גדול מהם יישבר עם הזמן ולא יהיה זמין להורדה. הכרטיס לא מפרט שפות, מקורות איסוף, חלוקה גאוגרפית או הטיות מובנות בטקסטים. בנוסף, מי שמשתמש במאגר לוקח על עצמו את הסיכון המשפטי בהורדה ובאחסון של התמונות בפועל.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

קובצי המטא-דאטה, שכוללים את הקישורים והטקסטים, מופצים תחת רישיון cc-by-4.0 שמתיר שימוש מסחרי עם מתן קרדיט. עם זאת, התמונות עצמן מוגנות בזכויות יוצרים של בעליהן המקוריים ברשת. השימוש בהן הוא באחריותכם הבלעדית ואינו מכוסה ברישיון המאגר.

האם המאגר כולל תמיכה בעברית?

הכרטיס אינו מציין אילו שפות קיימות במאגר או מה החלוקה ביניהן. היות שמדובר בסריקה רחבה מהרשת ייתכן שמופיע טקסט בעברית, אך אין התחייבות לכך. תצטרכו לדגום קבצי parquet ולבדוק את הטקסטים בעצמכם.

האם מקבלים את התמונות יחד עם ההורדה?

לא, המאגר מכיל רק קובצי parquet ו־npz עם קישורים וטקסטים נלווים. את התמונות עצמן עליכם להוריד ישירות משרתי המקור באינטרנט. זה דורש כתיבת סקריפטים מתאימים ומשאבי רוחב פס גדולים.

מה הסיכון המשפטי בהורדת המידע?

היוצרים מדגישים בתנאי השימוש שהאינדקס ניתן כפי שהוא לצורכי מחקר. כל הורדה ואחסון של התמונות נעשים על אחריות המשתמש בלבד. עליכם לוודא עמידה בחוקי זכויות יוצרים לגבי כל תמונה שאתם שומרים.

איך טוענים

העבודה כאן שונה מדאטהסט רגיל כי הוא מחזיק מטא-דאטה בלבד. הגישה חופשית ואין צורך באישור פרטני, אבל צריך להוריד אלפי קבצי parquet ו־npz ולמשוך את התמונות עצמאית מהרשת לפי הקישורים. מומלץ להכין תשתית רשת חזקה ואחסון מתאים לפני שמתחילים להוריד קבצים בקנה מידה כזה.

from datasets import load_dataset

ds = load_dataset("mlfoundations/datacomp_1b")

הרישיון

המטא-דאטה עצמו מופץ תחת רישיון cc-by-4.0 שמתיר שימוש מסחרי ומחקר בכפוף למתן ייחוס ליוצרים. התמונות עצמן אינן חלק מהרישיון הזה, וכל אחת מהן כפופה לזכויות היוצרים ולתנאי השימוש של האתר שממנו היא נמשכת בפועל.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗