GPT
M

MINT-1T-ArXiv

קוד פתוח

mlfoundationscc-by-4.02024-06-29

  • multimodal

מאגר מסמכים מדעיים המשלב טקסט ותמונות ברצף מתוך מאמרי מחקר. מתאים למי שמאמן מודלי ראייה ושפה על תוכן אקדמי מורכב ולא רק על דפי אינטרנט כלליים.

  • 9,662הורדות בחודש
  • 61לייקים

מה זה

המאגר כולל כ־0.6 מיליון מאמרי מחקר שנמשכו ישירות מתוך דליי האחסון של ArXiv ב־S3. בניגוד לנתוני רשת רגילים, הרשומות כאן מבוססות על קובצי המקור של המאמרים בפורמט LaTeX, אשר עברו פירוק ועיבוד מחדש כדי לשזור את התמונות, הגרפים והאיורים במקומם המדויק לצד פסקאות הטקסט הרלוונטיות.

תהליך הניקוי התבצע באמצעות TexSoup וכלל הסרה של פקודות ייבוא, ביבליוגרפיה, טבלאות ותגיות ציטוט. הטקסטים עברו זיהוי שפה ב־fasttext לסינון תכנים שאינם באנגלית, מיסוך כתובות דוא"ל וכתובות IP, וניפוי כפילויות בפסקאות ובמסמכים באמצעות מסנני בלום וכלי DCLM ו־bff. תמונות מתחת ל־150 פיקסלים או מעל 20,000 פיקסלים הוסרו, לצד בדיקות NSFW.

מתאים ל

  • אימון מקדים של מודלי ראייה

    אימון מודלים מולטימודליים על רצפים משולבים של פסקאות, תרשימים ואיורים אקדמיים.

  • הבנת מסמכים ומדע

    הוראת מודל להבין הקשר בין גרפים ותרשימים מדעיים לבין ההסבר הטקסטואלי סביבם.

  • מחקר על דאטה משולב

    הערכה ובדיקה של שיטות אימון על נתונים מרובי תמונות וטקסט בקנה מידה רחב.

איפה זה נופל

התוכן מוגבל לאנגלית בלבד ולמאמרים מדעיים, כך שהוא אינו מתאים למי שמחפש עברית או שפה טבעית יומיומית. בנוסף, עיבוד ה־LaTeX הסיר לחלוטין טבלאות וציטוטים, מה שפוגע במבנה המקורי של המאמרים. הכותבים מתריעים כי ייתכן שנותר תוכן אישי חרף המיסוך, ושוללים שימוש עבור יישומים צבאיים או מודלים לעיבוד פרטי זיהוי אישיים.

שאלות
נפוצות

האם המאגר כולל תוכן בעברית?

לא. הסינון הראשוני בוצע באמצעות fasttext והתמקד באנגלית בלבד. אם המטרה היא אימון בעברית, המאגר הזה לא רלוונטי עבורכם.

מותר להשתמש בזה למודל מסחרי?

הרישיון הוא CC-BY-4.0, שבאופן עקרוני מתיר שימוש מסחרי בכפוף לייחוס. עם זאת, היוצרים מדגישים שזהו תוצר מחקרי ושעל המשתמש לוודא בעצמו שאין פגיעה בזכויות יוצרים של המאמרים המקוריים.

מה ההבדל בין החלק הזה לשאר חלקי MINT-1T?

זהו תת-מאגר ייעודי של כ־0.6 מיליון מאמרים מ־ArXiv שעובדו מקובצי מקור ב־LaTeX. שאר הפרויקט כולל מעל מיליארד מסמכי HTML ומיליוני קובצי PDF שנסרקו מ־CommonCrawl.

איך בנויים הקבצים להורדה?

הנתונים מחולקים ל־8,090 קובצי tar דחוסים לפי תקן WebDataset. המבנה הזה מיועד לקריאה סדרתית מהירה במהלך אימון מודלים במקום פתיחה של מיליוני קבצים קטנים למערכת הקבצים.

איך טוענים

הנתונים מחולקים לאלפי קובצי ארכיון בפורמט WebDataset, כמו arXiv_src_0001_001_wds.tar. אין צורך באישור גישה מיוחד כדי להוריד, אך בשל היקף הנתונים והמבנה המפוצל ל־8,090 קבצים, מומלץ לעבוד בהזרמה ישירה לקוד האימון ולא לפרוס את כל הארכיונים לדיסק המקומי. השדות המרכזיים כוללים את רצף הטקסט הנקי לצד התמונות המשובצות בו.

from datasets import load_dataset

ds = load_dataset("mlfoundations/MINT-1T-ArXiv")

הרישיון

המאגר פורסם תחת רישיון CC-BY-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, כל עוד נותנים ייחוס מתאים ליוצרים, ואינו מחייב שיתוף באותו רישיון. עם זאת, היוצרים מציינים שהמאגר מיועד בראש ובראשונה למחקר, ומטילים על המשתמשים את האחריות לוודא עמידה בחוקי זכויות יוצרים לפני אימון מודל לשימוש מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗