GPT
S

SuperWikiImage-7M

קוד פתוח

recursalרישיון לא דווח2024-09-23

אוסף של כשבעה מיליון תמונות מוויקיפדיה וויקישיתוף בנפח של כ־15 טרה-בייט. הוא נבנה עבור מי שצריך היקף עצום של נתונים חזותיים רב-לשוניים לאימון מודלים מולטימודליים.

  • 6,469הורדות בחודש
  • 19לייקים

מה זה

המאגר מכיל כ־7 מיליון תמונות שנאספו מתוך דאמפים של ויקיפדיה בשפות שונות, וכולל קבצים בפורמטים מקוריים של JPG, JPEG ו־PNG ללא המרה מחדש. הצוות בחר מהדורות ויקיפדיה עם יותר מ־100,000 ערכים ומדד עומק שגדול מ־5.1, ביניהן גם הגרסה העברית.

הסינון הראשוני הוריד קבצים שאינם תמונות רגילות, ביצע ניקוי כפילויות לפי שמות קבצים, והסיר תמונות שלא כללו תיאור בלפחות שפה אחת. בנוסף, הוסרו תמונות של שטרות כסף ותמונות עם רישיונות שהוכנסו לרשימה שחורה, כמו הגבלות של בנקים מרכזיים. הנתונים ארוזים במבנה של WebDataset בתוך 3,380 קובצי ארכיון המחולקים למקטעים.

מתאים ל

  • אימון מודלי שפה מולטימודליים

    חיבור תמונות מוויקיפדיה לתיאורים טקסטואליים בשפות שונות כדי ללמד מודל להבין הקשר ויזואלי.

  • אימון מחוללי תמונות

    שימוש במיליוני התמונות כבסיס ראשוני ללימוד ייצור תמונות לפי תיאור טקסטואלי.

  • סיווג תמונות רחב היקף

    בניית מודלים שמזהים ישויות, אתרים היסטוריים, אישים ועצמים מתוך מאגר אנציקלופדי מגוון.

איפה זה נופל

הכרטיס מודה שלא נעשה כאן סינון איכות מקיף מעבר להסרת שטרות כסף וסינון רישיונות בסיסי. התמונות מגיעות מתוך ערכים אנציקלופדיים, ולכן תמצאו שם תרשימים, מפות, צילומי מסמכים ודיאגרמות לצד צילומים רגילים, מה שעלול לייצר רעש במשימות הדורשות תמונות טבעיות בלבד. בנוסף, למרות שהסינון דרש תיאור בלפחות שפה אחת, איכות התיאורים והתאמתם לתמונה משתנה מאוד בין שפות ולא נבדקה ידנית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

המאגר מוגדר עם רישוי מעורב ולא ברור. חלק מהתמונות שייכות לנחלת הכלל או תחת רישיונות מתירניים, אבל חלק משמעותי נמצא תחת רישיונות שיתוף זהה שמחייבים פתיחת נגזרות. אם אתם בונים מודל מסחרי קנייני, תצטרכו לסנן החוצה את כל הקבצים שאינם CC0 או דומים לו.

כמה נפח אחסון נדרש כדי להוריד אותו?

המאגר תופס כ־15 טרה-בייט ומחולק לאלפי קובצי ארכיון. אי אפשר לעבוד איתו בסביבה מקומית רגילה, ותצטרכו תשתית ענן או שרת אחסון ייעודי עם חיבור מהיר לרשת.

האם הדאטהסט כולל נתונים בעברית?

כן, הוויקיפדיה העברית עמדה בקריטריונים של היוצרים עם מעל 100,000 ערכים ומדד עומק מספק, ולכן נכללה בסריקה. תמונות רבות שמופיעות בערכים בעברית או שיש להן תיאור בעברית נמצאות בתוך הקבצים.

באיזה פורמט המידע שמור ואיך ניגשים אליו?

התמונות שמורות בפורמט WebDataset בתוך 3,380 קובצי tar שמחולקים לפי מקטעים. הגישה מתבצעת ישירות דרך ספריית webdataset בפייתון בלי צורך לפתוח מראש את כל קובצי הארכיון לכונן.

איך טוענים

הטעינה נעשית באמצעות ספריית WebDataset ישירות מעשרות אלפי קובצי ה־tar במאגר, ללא צורך באישור גישה מוקדם. לפני שמתחילים להוריד, חובה לוודא שיש לכם לפחות 15 טרה-בייט של אחסון מהיר פנוי ורוחב פס מתאים. הקוד שלכם צריך לבדוק סיומות שונות עבור כל קובץ, כי המאגר משמר את הסיומת המקורית של ויקישיתוף ולא מאחד אותן לפורמט בודד.

from datasets import load_dataset

ds = load_dataset("recursal/SuperWikiImage-7M")

הרישיון

למאגר עצמו אין רישיון אחיד מוצהר, והמצב המשפטי שלו מוגדר כמעורב ומורכב. היוצרים כללו רק תמונות בעלות רישיונות פתוחים מסוימים כמו CC-BY, CC-SA, נחלת הכלל ורישיונות קוד פתוח שונים, אך יש קבצים שדורשים ייחוס או שיתוף זהה. לא הייתי מכניס את המאגר הזה למוצר מסחרי סגור בלי לסרוק את קובץ המטא-דאטה ולבודד רק את התמונות ששוחררו ללא הגבלת שיתוף זהה.

הרישיון המלא ב־Hugging Face ↗