GPT
M

MegaMath

קוד פתוח

IFModc-by2025-03-30

  • math
  • code
  • pre-training
  • synthesis

מאגר ענק לאימון מקדים של מודלים במתמטיקה עם מעל 300 מיליארד תוקנים. הוא משלב חילוץ מותאם של תוכן מתמטי מהרשת, קוד רלוונטי ודאטה סינתטי כדי לשפר יכולות חישוב והסקה.

  • 154,453הורדות בחודש
  • 133לייקים

מה זה

המאגר כולל 215.1 מיליון דוגמאות ומעל 371 מיליארד תוקנים בסך הכל, ומחולק לשלושה תחומים מרכזיים. המקור העיקרי הוא דפי רשת שנשלפו מחדש מתוך Common Crawl באמצעות חילוץ ייעודי למבני HTML מתמטיים, סינון מבוסס fasttext והסרת כפילויות. חלק זה תופס את רוב הנפח עם 279 מיליארד תוקנים המחולקים לרשת רגילה ומסמכי Web-Pro.

החלק השני כולל קוד מתמטי שבודד מתוך מאגר Stack-V2 בהיקף של 28.1 מיליארד תוקנים. החלק השלישי הוא תוכן סינתטי שנבנה על בסיס הרשת והקוד בהיקף של 64.5 מיליארד תוקנים, ומכיל שאלות ותשובות, קוד מתורגם ובלוקים משולבים של טקסט וקוד.

מתאים ל

  • אימון מקדים למודלים

    הרחבת יכולות החישוב וההסקה של מודלי שפה על בסיס מאות מיליארדי תוקנים של טקסט מדעי ומתמטי.

  • אימון משולב של קוד וטקסט

    שימוש בבלוקים סינתטיים ובנתוני Stack-V2 כדי ללמד מודלים לפתור בעיות מתמטיות בעזרת תכנות.

  • התאמה למשימות שאלות ותשובות

    אימון על 22.6 מיליון דוגמאות QA מתמטיות לצורך שיפור ביצועים במענה על שאלות כמותיות.

איפה זה נופל

הנתונים מוגדרים באנגלית בלבד ואין במאגר ייצוג לשפות אחרות או לעברית. מקורות הרשת מבוססים על חילוץ אוטומטי וסינון fasttext, מה שעדיין עלול להשאיר שגיאות עימוד בנוסחאות מורכבות. בנוסף, קרוב לשליש מהרשומות הן דאטה סינתטי שנוצר ממודלים, דבר שמחייב בדיקה של הזיות, שגיאות לוגיות ואיכות הפתרונות לפני שמבססים עליו מודל ייצורי.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

הרישיון הוא ODC-By, מה שמאפשר שימוש מסחרי ואימון מודלים. הדרישה העיקרית היא מתן קרדיט וייחוס מתאים ליוצרים המקוריים.

האם יש במאגר תוכן בעברית?

המאגר מוגדר רשמית באנגלית בלבד. כל הטקסטים שחולצו מהרשת, השאלות והתשובות והקוד מתבססים על השפה האנגלית, ולכן הוא לא מתאים לאימון ישיר על מתמטיקה בעברית.

במה הוא שונה ממאגרים כמו DeepSeekMath?

לפי נתוני הכרטיס המאגר מכיל מעל 300 מיליארד תוקנים ועוקף את DeepSeekMath שמכיל 120 מיליארד. בנוסף הוא כולל שילוב רחב של דאטה סינתטי וקוד מתמטי ייעודי מ־Stack-V2.

כמה שטח אחסון נדרש כדי להשתמש בו?

המאגר כולל 5,317 קבצי Parquet שמכילים מעל 371 מיליארד תוקנים בסך הכל. מדובר בנפח של מאות גיגה-בייט לפחות, ועדיף לעבוד בהזרמה או להוריד רק חלוקות ספציפיות.

איך טוענים

הדאטהסט פתוח להורדה ישירה ללא צורך בהרשאת גישה מיוחדת, ומאוחסן בפורמט Parquet המחולק ל־5,317 קבצים. כדי לעבוד איתו צריך תשתית אחסון ועיבוד רצינית, כי פריסה מלאה של מאות מיליארדי תוקנים דורשת משאבים כבדים. אפשר לטעון אותו בעזרת ספריית datasets של Hugging Face תוך הזרמת נתונים או משיכת תיקיות ספציפיות כמו megamath-code אם רוצים רק את גזרת הקוד.

from datasets import load_dataset

ds = load_dataset("IFM/MegaMath")

הרישיון

המאגר מופץ תחת רישיון ODC-By. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולבנות על גביו מודלים חדשים. התנאי המרכזי הוא מתן קרדיט מתאים ליוצרים המקוריים לפי דרישות הרישיון, ללא חובה לשתף את המודלים שתאמנו תחת אותו רישיון בדיוק.

הרישיון המלא ב־Hugging Face ↗