GPT
M

MINT-1T-HTML

קוד פתוח

mlfoundationscc-by-4.02024-07-21

  • multimodal

מאגר ענק של מסמכי רשת המשלבים טקסט ותמונות ברצף טבעי, שנועד לאימון מודלי שפה רב מודליים. הוא מציע קנה מידה של מאות מיליארדי תווים פתוחים לחלוטין למחקר.

  • 234,210הורדות בחודש
  • 97לייקים

מה זה

המאגר מכיל דפי רשת בפורמט HTML שחולצו מתוך סריקות של CommonCrawl בין השנים 2017 ל־2024. הרשומות מציגות רצף שבו טקסט ותמונות שזורים זה בזה כפי שהופיעו במקור, כדי לאפשר למודלים ללמוד הקשר חזותי וטקסטואלי במקביל.

הסינון כלל זיהוי אנגלית באמצעות fasttext, הסרת כפילויות ברמת הפסקה והמסמך בעזרת מסנני בלום, והסרת תמונות שלא עמדו בטווחי גודל של 150 עד 20,000 פיקסלים או יחס ממדים של 2:1. המפתחים השתמשו במסווגי תוכן בוטה כדי לסנן תמונות לא הולמות, ומסכו פרטי זיהוי כמו כתובות אימייל ו־IP. הגרסה העדכנית data_v1_1 כוללת 742 מיליארד טוקנים של טקסט לאחר ניקוי כותרות עליונות ותחתונות מהדפים.

מתאים ל

  • אימון מודלי בסיס רב מודליים

    אימון מקדים של מודלים שצריכים לעבד טקסט ותמונות ברצף אחיד.

  • מחקר על דאטה רב מודלי

    בדיקת השפעת שיטות סינון וניקוי על ביצועי מודלי ראייה ושפה.

  • יצירת כתוביות והבנת תמונות

    אימון מודלים להבנת הקשר בין פסקאות שלמות לאיורים ותרשימים.

איפה זה נופל

המאגר מוגבל לשפה האנגלית בלבד, ואין בו שום ייצוג לעברית. הבעיה המרכזית בפועל היא תלות בקישורי תמונות חיצוניים מהרשת, שסובלים מריקבון קישורים ונעלמים עם הזמן, מה שאומר שהשחזור המדויק של המאגר הולך ונשחק. למרות סינוני בטיחות כפולים, היוצרים מודים שייתכן שעדיין קיימים תכנים פוגעניים או מידע פרטי שלא סונן. בנוסף, חל איסור מפורש מצד היוצרים להשתמש במידע לפיתוח יישומים צבאיים או לזיהוי פנים ופרטים אישיים.

שאלות
נפוצות

האם המאגר כולל תוכן בעברית?

לא. הסינון הראשוני של המאגר השתמש במודל fasttext כדי להשאיר אך ורק תוכן באנגלית. אם אתם מחפשים לאמן מודל על מסמכים מקומיים או דו לשוניים, המאגר הזה לא יספק את הסחורה.

האם התמונות עצמן שמורות בתוך הקבצים?

לא, קובצי ה־Parquet כוללים קישורים לתמונות המקוריות ברשת לצד הטקסט. המשמעות היא שתצטרכו להוריד את התמונות בעצמכם, וחלק בלתי מבוטל מהן עלול לא להיות זמין בגלל אתרים שנסגרו או שינו נתיב.

מותר להשתמש במאגר לאימון מודל מסחרי?

הרישיון הוא CC-BY-4.0 שאינו אוסר מסחור, אך דורש מתן קרדיט. יחד עם זאת, היוצרים מבהירים שמדובר בנתונים שנקצרו מהאינטרנט וממליצים לבדוק היבטים משפטיים וזכויות יוצרים באופן עצמאי לפני שימוש כזה.

באיזו גרסה של הדאטהסט כדאי להשתמש?

מומלץ לעבוד עם תיקיית data_v1_1. בגרסה זו נוקו כותרות עליונות ותחתונות מהדפים כדי להפחית רעש טקסטואלי, והיא כוללת 742 מיליארד טוקנים לעומת גרסאות קודמות.

איך טוענים

הנתונים מחולקים ליותר מ־9,200 קובצי Parquet שונים תחת תיקיות גרסה, ללא צורך באישור גישה מיוחד בהאגינג פייס. כדי לעבוד איתו צריך תשתית אחסון ועיבוד רצינית מאוד, במיוחד בהתחשב בכך שהתמונות עצמן מבוססות על קישורים חיצוניים שיש להוריד בזמן אמת ולא על קבצים מקומיים השמורים במאגר.

from datasets import load_dataset

ds = load_dataset("mlfoundations/MINT-1T-HTML")

הרישיון

הרישיון הוא CC-BY-4.0 שמתיר עקרונית שימוש מסחרי, שינוי והפצה, בתנאי שניתן קרדיט מתאים ליוצרים. עם זאת, החוקרים מדגישים שזהו תוצר מחקרי ושמקור המידע הוא סריקת אתרים ציבוריים, כך שעל המשתמש המסחרי חלה החובה לוודא עצמאית עמידה בחוקי זכויות יוצרים ופרטיות לפני הטמעה במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗