GPT
M

MegaMath-Web-Pro-Max

קוד פתוח

OctoThinkerodc-by2025-06-25

מאגר מתמטיקה מהרשת שעבר סינון קפדני ושכתוב במודל שפה, ומיועד לאימון ביניים לפני שלב החיזוק. הוא נבנה כדי לדחוף את יכולות החשיבה והפתרון של מודלים קטנים וגדולים.

  • 4,977הורדות בחודש
  • 41לייקים

מה זה

המאגר מבוסס על דגימה רנדומלית ומאוזנת לפי שנות פרסום מתוך קורפוס הרשת MegaMath-Web, ומכיל מיליוני מסמכים מתמטיים. תהליך הסינון התבסס על ניקוד של מודל Llama-3.1-70B-instruct באמצעות פרומפט מתוך פרויקט FineMath, ששימש כדאטה ראשוני לאימון מודל fasttext ייעודי. לאחר מכן, מסמכים מהרשת עברו סינון מהיר עם סף ציון של 0.4.

השלב המרכזי שמבדיל את הגרסה הזו מגרסאות בסיסיות הוא עיבוד מחדש בקנה מידה רחב. כל מסמך ששרד את הסינון הראשוני שוכתב ולוטש על ידי Llama-3.1-70B-instruct באמצעות פרומפט ייעודי לשיפור האיכות. הטקסטים מכילים תוכן מתמטי מעובד מהאינטרנט, במטרה לשפר ביצועים הן באימון מקדים המשכי והן בשלב למידת החיזוק שבא אחריו.

מתאים ל

  • אימון ביניים למודלי שפה

    חיזוק יכולות החישוב וההסבר המתמטי של המודל על ידי חשיפה לטקסטים ששופרו במיוחד.

  • הכנה לשלב למידת חיזוק

    יצירת בסיס מוצק לפיתוח מודלים שנועדו להשתפר דרך למידת חיזוק ומשימות חשיבה.

  • המשך אימון מקדים למודלים

    אימון מודלים קומפקטיים על טוקנים איכותיים מתחום המתמטיקה כדי לשפר ביצועים כלליים.

איפה זה נופל

חלק נכבד מאיכות הטקסט תלוי לחלוטין ביכולת השכתוב של Llama-3.1-70B-instruct, מה שעלול לייבא הזיות או שגיאות עדינות בניסוחים מתמטיים. מעבר לכך, התיעוד לא מפרט אילו שפות קיימות בפועל, כך שסביר להניח שהרוב המוחלט באנגלית וללא כל תמיכה בטקסטים בעברית. חסר גם פירוט לגבי התפלגות השנים או הנושאים המדויקים, ולכן צריך לבדוק מדגמית את הטקסטים כדי לוודא שאין בהם עיוותים מתמטיים לפני שמכניסים אותם לאימון של מודל פרודקשן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

הרישיון המדווח הוא odc-by, שמתיר שימוש מסחרי כל עוד שומרים על חובת הייחוס והקרדיט ליוצרים. עם זאת, הטקסטים שוכתבו באמצעות מודל חיצוני של Llama, ולכן כדאי להכיר גם את תנאי השימוש של מטא בנוגע לנתונים שנוצרו על ידו.

איך נאספו ונוקו הנתונים בפועל?

המסמכים נדגמו ממאגר MegaMath-Web לפי שנות פרסום, סוננו במודל fasttext שאומן על ציונים של מודל שפה, ולבסוף עברו עיבוד מחדש. מודל Llama-3.1-70B-instruct שכתב את התוכן בעזרת פרומפט ייעודי כדי להעלות את רמת הטקסט.

האם יש במאגר תוכן בעברית?

דף המאגר והמאמר אינם מציינים תמיכה בריבוי שפות או נוכחות של עברית. מאחר שמדובר בקורפוס רשת מתמטי שעבר סינון ושכתוב במודל שהונחה באנגלית, סביר מאוד להניח שהחומר כולו באנגלית בלבד.

מה ההבדל בין גרסה זו לגרסאות קודמות של הדאטהסט?

ההבדל העיקרי הוא שלב הליטוש הסופי באמצעות מודל שפה גדול. בעוד שגרסאות מוקדמות או בדיקות בסיס הסתפקו רק בסינון מסמכי מקור גולמיים לפי סף איכות, כאן המסמכים עברו שכתוב מקיף ששיפר את תוצאות המודלים.

איך טוענים

המאגר מופץ כסט של 106 קובצי parquet פתוחים להורדה, ללא צורך בהרשאת גישה מיוחדת או אישור מקדים. אפשר למשוך אותו ישירות דרך ספריית datasets הרגילה של פייתון או להוריד את הקבצים הבודדים מהמאגר לעיבוד מקומי. כדאי לקחת בחשבון שמדובר בכמות גדולה של קבצים שמחולקים במבנה ממוספר, כך ששווה לעבוד בטעינה מוזרמת כדי לא לחנוק את הזיכרון, ולבדוק את מבנה הרשומות בתוך קובץ בודד לפני שמריצים פייפליין אימון מלא על כל התיקיות.

from datasets import load_dataset

ds = load_dataset("OctoThinker/MegaMath-Web-Pro-Max")

הרישיון

המאגר פורסם ברישיון odc-by, שמאפשר שימוש חופשי כולל שימוש מסחרי, שינוי והפצה של הנתונים. התנאי העיקרי הוא מתן קרדיט וייחוס הולם ליוצרים המקוריים לפי דרישות הרישיון. בניגוד לרישיונות שיתוף זהה, הוא אינו כופה עליכם לפרסם את המודלים שאומנו עליו או נגזרות של הקוד באותו רישיון בדיוק.

הרישיון המלא ב־Hugging Face ↗