GPT
N

Nemotron-Math-v2

קוד פתוח

nvidiacc-by-4.0,cc-by-sa-4.02025-12-15

  • mathematical-reasoning
  • tool-use
  • long-context

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר מתמטי ענק לאימון מודלים שכולל כ־347,000 בעיות וכ־7 מיליון מסלולי פתרון מנומקים, שנוצרו בידי מודל שפה ונבדקו אוטומטית.

  • 21,194הורדות בחודש
  • 192לייקים

מה זה

המאגר מורכב משני מקורות עיקריים של בעיות שנאספו מפורומים ברשת: כ־85K שאלות מקהילת AoPS, וכ־262K שאלות שמקורן ב־Math StackExchange וב־MathOverflow. הטקסטים המקוריים עברו סינון אגרסיבי בעזרת מודלי שפה כדי לחלץ ניסוחי שאלות מוגדרים היטב, לנקות שאלות הוכחה, שאלות רב-ברירה, תוכן לא ברור ודליפות למבחני ביצועים ציבוריים.

עבור כל בעיה, המודל gpt-oss-120b יצר מסלולי פתרון בשישה מצבי עבודה שמשלבים שלוש רמות עומק שונות של הנמקה לצד עבודה עם או בלי הרצת פייתון. פתרונות שגויים נזרקו באמצעות שופט מבוסס מודל, ושאלות קלות מדי שהמודל פתר ביותר מ־80 אחוז מהמקרים בהנמקה נמוכה הוסרו לחלוטין. התוצאה מחולקת לשלוש רמות: low עם 1,718,159 רשומות, medium עם 2,502,305 רשומות, ו־high עם 2,865,375 רשומות, ובסך הכל 7,085,839 מסלולים מאומתים.

מתאים ל

  • אימון יכולות הנמקה

    אימון מודלי שפה על תהליכי חשיבה מתמטיים ארוכים ברמות עומק שונות.

  • אינטגרציית קוד ככלי עזר

    לימוד מודלים לשלב חישובי פייתון במהלך פתרון בעיה מתמטית סבוכה.

  • מחקר על עקביות פתרונות

    ניתוח מגוון דרכי הפתרון של מודלים לאותה שאלה וזיהוי דפוסי שגיאה.

איפה זה נופל

החולשה המרכזית נעוצה בהסתמכות על מערכת שיפוט סינתטית. אם המודל לא מצא את הפתרון של הפורום המקורי, התשובה הנכונה נקבעה לפי רוב בין הפלטים של המודל עצמו, מה שעלול לקבע טעויות עקביות. שאלות הוכחה הוסרו לגמרי כדי להבטיח בדיקה פשוטה של תשובה סופית, כך שהדאטהסט מוגבל למציאת ערך בלבד. כל הטקסטים באנגלית בלבד, ואין כאן בעיות או הסברים בעברית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

היוצרים מציינים שהמאגר מוכן לשימוש מסחרי, אך חלים עליו שני רישיונות שונים. תת-המאגר של AoPS מוגן ברישיון CC BY 4.0 שדורש ייחוס בלבד, בעוד שאר הנתונים מוגנים ברישיון CC BY-SA 4.0. הדרישה לשיתוף זהה בחלק של SA עלולה להגביל שילוב במודלים קנייניים סגורים.

כמה שטח אחסון נדרש להורדת הנתונים?

נפח האחסון הכולל של הקבצים עומד על כ־143GB. המאגר מפוצל לקובצי Parquet ו־JSONL, כך שמומלץ לבחור בפורמט אחד או בתת-קבוצה לפי רמת הקושי הדרושה.

האם יש במאגר שאלות או פתרונות בעברית?

לא. הנתונים מוגדרים ומקוטלגים כולם בשפה האנגלית, שכן המקורות הם פורומים בינלאומיים כמו AoPS ו־Math StackExchange.

איך נאספו ואומתו הפתרונות בנתונים?

הבעיות חולצו מפורומים וסוננו בעזרת מודלי שפה, ואת מסלולי הפתרון יצר המודל gpt-oss-120b בשש תצורות שונות. התשובות עברו בדיקה אוטומטית מול הפתרון המקורי או נקבעו בהצבעת רוב של פלטי המודל, ובעיות קלות מדי סוננו החוצה.

איך טוענים

המאגר פתוח להורדה ללא דרישת אישור גישה מראש, ומגיע בקובצי JSONL ו־Parquet בנפח כולל של כ־143GB בדיסק. הרשומות כוללות את שדות הבעיה problem, מערך שיחה סטנדרטי messages, תשובת הייחוס expected_answer, דגל שמציין אם התשובה שונתה לפי רוב changed_answer_to_majority, כלי פייתון אם הופעל, ומטא-דאטה עם שיעורי ההצלחה של המודל בתצורות השונות.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Math-v2")

הרישיון

המאגר מחולק לשני רישיונות לפי מקור הבעיות. חלק ה־AoPS כפוף לרישיון CC BY 4.0 שמאפשר שימוש מסחרי תחת מתן קרדיט. החלקים שמקורם ב־StackOverflow ו־MathGenSelect כפופים לרישיון CC BY-SA 4.0, שמחייב שיתוף באותם תנאים. המשמעות היא ששילוב הנתונים הללו עלול לחייב אתכם לשחרר תוצרי נגזרת או מודלים תחת רישיון פתוח זהה.

הרישיון המלא ב־Hugging Face ↗