GPT
I

InfiMM-WebMath-40B

קוד פתוח

Infi-MModc-by2024-09-12

  • pretrain
  • multi-modal
  • mathematical-reasoning
  • geometry

המאגר מרכז 24 מיליון מסמכי רשת שמשלבים טקסט מתמטי עם תרשימים ואיורים מקבילים. הוא מיועד לאימון מקדים של מודלי שפה רב מודליים שצריכים להבין הוכחות, גרפים ונוסחאות.

  • 1,989הורדות בחודש
  • 69לייקים

מה זה

הנתונים מבוססים על דפי אינטרנט שנשלפו ממאגרי Common Crawl בין השנים 2019 ל־2023. הם כוללים 40 מיליארד טוקנים של טקסט וכ־85 מיליון קישורים לתמונות, כולם סביב תכנים מדעיים ומתמטיים באנגלית ובסינית בלבד.

המבנה של כל רשומה שומר על הסדר המקורי שבו התוכן הופיע ברשת. המידע מחולק לשני מערכים מקבילים, text_list ו־image_list, כך שכאשר יש טקסט המערך השני מחזיר None, וכשיש תמונה מופיע קישור ישיר לקובץ שלה. זה שומר על רצף הקריאה הטבעי שבין ההסבר המילולי לתרשים המצורף.

תהליך הסינון התחיל מ־120 מיליארד דפים. הוא כלל חילוץ טקסט עם Trafilatura וזיהוי שפה, סינון ראשוני של מתמטיקה באמצעות FastText ברגישות גבוהה, הסרת כפילויות בעזרת MinHash, וסינון תכנים לא הולמים. לאחר מכן הופעל סינון FastText נוסף בדיוק גבוה, ונופו תמונות שלא קשורות לחומר כמו לוגואים ובאנרים.

מתאים ל

  • אימון מקדים למודלים רב מודליים

    לימוד קריאה משולבת של טקסט מדעי לצד תרשימים גיאומטריים וגרפים ישירות מרצף המסמך.

  • פתרון בעיות גיאומטריות

    אימון מודלים להבנת הקשר בין נוסחאות להמחשות חזותיות במתמטיקה מתקדמת.

  • סינון והעשרת דאטה מתמטי

    שימוש בציוני ההסתברות של Llama 3 כדי לחלץ מקורות איכותיים בלבד למחקרי המשך.

איפה זה נופל

החיסרון הברור ביותר הוא היעדר עברית. המאגר מוגבל לאנגלית וסינית, כך שהוא לא יעזור למי שבונה מודל שמיועד להבין שאלות מתמטיות בעברית. בנוסף, המאגר לא מחזיק את קובצי התמונה עצמם אלא רק קישורים, ודפים שנאספו החל מ־2019 עלולים לכלול קישורים שבורים רבים. החומר מתבסס כולו על סריקת רשת רחבה, כך שלמרות מודלי הסינון של FastText, עדיין עלולים להסתנן פנימה פתרונות שגויים, תרשימים לא מדויקים והסברים חלקיים.

שאלות
נפוצות

האם יש במאגר תוכן בעברית?

לא. המאגר סונן מראש באמצעות LangDetect וכולל אך ורק תכנים באנגלית ובסינית.

האם התמונות עצמן נמצאות בקובצי ה־Parquet?

לא, הקבצים כוללים רק קישורי URL לתמונות המקוריות ברשת. כדי לאמן מודל תצטרכו להוריד את עשרות מיליוני התמונות בעצמכם, ולקחת בחשבון שחלק מהקישורים כבר אינם פעילים.

מותר להשתמש במאגר לפיתוח מוצר מסחרי?

רישיון ODC-By מתיר שימוש מסחרי בכפוף למתן קרדיט. יחד עם זאת, התוכן נאסף מאתרי אינטרנט ציבוריים וכפוף לתנאי השימוש של Common Crawl ולזכויות היוצרים המקוריות של בעלי האתרים.

איך אפשר להבטיח שהתוכן המתמטי אכן מדויק ולא סתמי?

החוקרים ביצעו שני שלבי סינון מבוססי FastText, והוסיפו לכל רשומה ציוני math_prob המבוססים גם על Llama 3. אתם יכולים לקבוע סף גבוה יותר לשדות האלה כדי לסנן דפים גבוליים.

איך טוענים

המאגר מורכב מ־402 קובצי Parquet דחוסים ב־gzip, פתוח לחלוטין להורדה ישירה ללא צורך בהרשאה מוקדמת. הקבצים מכילים את הטקסט ואת הקישורים לתמונות, מה שאומר שתצטרכו להריץ סקריפט הורדה עצמאי כדי למשוך את 85 מיליון התמונות בפועל אל השרת שלכם. במטא-דאטה תמצאו את השדות math_prob ו־math_prob_llama3, המאפשרים לסנן החוצה דפים עם ציון התאמה מתמטי נמוך כדי לעבוד עם מידע מזוקק יותר.

from datasets import load_dataset

ds = load_dataset("Infi-MM/InfiMM-WebMath-40B")

הרישיון

המאגר מופץ ברישיון ODC-By 1.0, שמתיר שימוש מסחרי, שינוי ושילוב במודלים, בתנאי שנותנים קרדיט מתאים ליוצרים. עם זאת, החומר נשען על Common Crawl ותנאי השימוש שלהם מחייבים גם כאן, והיוצרים מבהירים שהם לא שינו את זכויות היוצרים המקוריות של התכנים שנאספו מהרשת.

הרישיון המלא ב־Hugging Face ↗