GPT
O

OBELICS

קוד פתוח

HuggingFaceM4cc-by-4.02023-05-30

מאגר ענק של מסמכי רשת באנגלית המשלבים טקסט ותמונות ברצף טבעי. הוא מיועד למי שמאמן מודלי שפה ויזואליים וצריך הקשר רחב יותר מצמדי תמונה וטקסט פשוטים.

  • 13,531הורדות בחודש
  • 173לייקים

מה זה

המאגר כולל 141,047,697 מסמכים שמכילים יחד 115 מיליארד טוקנים של טקסט וקישורים ל־353 מיליון תמונות. המידע נשלף מסריקות Common Crawl שנעשו בין פברואר 2020 לפברואר 2023, וסונן כדי להסיר תמונות שיוצריהן ביקשו לא לאמן עליהן דרך Spawning API.

כל רשומה מייצגת עמוד רשת ומורכבת מרשימות מקבילות של טקסטים ותמונות. המבנה שומר על הסדר המקורי של העמוד, כך שאם יש תמונה ואחריה פסקה, הן יופיעו בדיוק ברצף הזה לפי אינדקסים, יחד עם שדות מטא-דאטה על ה־URL המקורי וטקסט אלטרנטיבי לתמונה. יש במאגר רק חלוקה אחת של אימון.

מתאים ל

  • אימון מודלי ראייה-שפה

    בניית מודלים שמבינים רצף חופשי של פסקאות ותמונות יחד, כמו IDEFICS.

  • יצירת טקסט על מספר תמונות

    אימון מערכות שמסוגלות להפיק פסקאות ארוכות ומקושרות על בסיס כמה תמונות ברצף.

  • מחקר על דאטה מולטימודלי

    ניתוח הטיות, כפילויות ומאפייני טקסט ותמונה במסמכי רשת בקנה מידה רחב.

איפה זה נופל

כל התוכן באנגלית בלבד ואין פה עברית. הנתונים מגיעים מהרשת הפתוחה ומכילים הטיות מגדריות שהחוקרים מצאו בבדיקות nPMI, לצד תוכן שלא מתאים לכל קהל כמו פורנוגרפיה, פרסומות לשירותי מין ודיווחים על אלימות וירי. בנוסף, קישורי תמונות ברשת נוטים להישבר עם הזמן, מה שאומר שלא כל 353 מיליון התמונות יהיו זמינות להורדה היום.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, רישיון CC-BY-4.0 מאפשר שימוש מסחרי. עם זאת, היוצרים מחייבים אתכם לדווח בגלוי שהשתמשתם במאגר אם אתם משחררים את המודל, ובנוסף עליכם לוודא עמידה ברישיונות המקור של האתרים שנשמרו.

כמה מקום אחסון צריך בשבילו?

קבצי הטקסט והקישורים בפורמט Parquet תופסים 377 גיגה-בייט, או כ־667 גיגה-בייט ב־Arrow. אם תרצו להוריד את כל 353 מיליון התמונות למחשב, תצטרכו עשרות טרה-בייט נוספים של שטח אחסון מקומי.

האם יש בדאטהסט תמיכה בעברית?

לא. המאגר מוגדר ומכיל מסמכים בשפה האנגלית בלבד שנאספו מ־Common Crawl.

מה ההבדל בין המאגר הזה למאגרי תמונות רגילים?

מאגרים רגילים מכילים בדרך כלל צמדים בודדים של תמונה אחת עם תיאור קצר. המאגר הזה שומר על מבנה של עמוד אינטרנט שלם, שבו טקסטים ותמונות מופיעים לסירוגין ברצף עריכתי.

איך טוענים

הנתונים יושבים ב־1,432 קובצי Parquet בנפח כולל של 377 גיגה-בייט, או 666.6 גיגה-בייט בפורמט Arrow. אין צורך לבקש אישור גישה. חשוב לדעת שהמאגר לא מחזיק את התמונות עצמן אלא כתובות URL בלבד, כך שצריך להוריד אותן לבד עם כלי כמו img2dataset. טוענים אותו ישירות דרך ספריית datasets, וכדאי להשתמש בקונפיגורציה opt_out_docs_removed_2023_07_12 שמסננת 4.25% מהמסמכים שביקשו הסרה.

from datasets import load_dataset

ds = load_dataset("HuggingFaceM4/OBELICS")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0 שמתיר שימוש מסחרי, שינוי והפצה, כל עוד נותנים קרדיט מתאים. תנאי השימוש דורשים לציית גם לרישיונות המקוריים של האתרים מהם נלקח התוכן, ומחייבים אתכם להצהיר פומבית שהשתמשתם במאגר אם אתם משחררים מודל או אפליקציה שאומנו עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗