GPT
N

Nemotron-SFT-Math-v4

קוד פתוח

nvidiacc-by-4.0,cc-by-sa-4.02026-05-26

  • math
  • mathematical-reasoning
  • text
  • blend
  • Nemotron_3_Ultra

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר לאימון מודלים על פתרון בעיות מתמטיקה מורכבות בעזרת שרשראות חשיבה סינתטיות. אנבידיה לקחה בעיות קשות מאתרים מוכרים ויצרה פתרונות שנבדקו מול תשובות סופיות.

  • 7,934הורדות בחודש
  • 44לייקים

מה זה

המאגר כולל 545,431 רשומות שמיועדות לאימון מונחה של מודלי שפה על מתמטיקה. הבעיות עצמן מגיעות משני מקורות מרכזיים, קהילת Art of Problem Solving ופורומים של Math StackExchange יחד עם MathOverflow. המפתחים סיננו שאלות הוכחה כדי להישאר עם בעיות שיש להן תשובה מספרית או סופית שניתן לאמת אוטומטית, וניקו שאלות טריוויאליות לצד בעיות שמופיעות במבחני ביצועים ציבוריים מוכרים.

הפתרונות נוצרו בצורה סינתטית באמצעות המודל DeepSeek-V4-Pro במצב הסקה גבוה, ואנבידיה שמרה רק דוגמאות שבהן התשובה הסופית שהמודל הפיק תאמה במדויק את התשובה המקורית. הנתונים מחולקים לשני תתי סוגים עיקריים, שרשראות חשיבה רגילות שכוללות 285,516 דוגמאות, ופתרונות מבוססי שילוב כלים חיצוניים שכוללים 259,915 דוגמאות.

מתאים ל

  • אימון SFT למתמטיקה

    לימוד מודלים לפתור בעיות אלגברה, גיאומטריה וקומבינטוריקה בשלבים מפורטים.

  • אימון משולב כלים חיצוניים

    שימוש בתת המאגר שמכיל קריאות לפונקציות וכלים כדי ללמד מודל להריץ חישובים.

  • מחקר על שרשראות הסקה

    ניתוח אופן ההסקה הארוך של מודלי שפה ובדיקת שיטות לאימות צעדי פתרון.

איפה זה נופל

הנתונים כולם באנגלית בלבד, ואין כאן שום ייצוג לבעיות או ניסוחים בעברית. סינון שאלות ההוכחה משאיר את המאגר מוגבל לחישובים ותשובות סופיות סגורות, כך שהוא לא יעזור אם המטרה שלכם היא ללמד מודל לכתוב הוכחות מתמטיות מלאות או תיאורטיות.

בנוסף, כל הפתרונות נוצרו על ידי מודל יחיד של דיפסיק, מה שעלול לייצר דפוסי שגיאה או סגנון הסקה אחיד מדי. העובדה שהתשובה הסופית נכונה גם לא מבטיחה שכל צעד בדרך נטול הזיות.

אותה משפחה

Nemotron-SFT-Math יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

מותר, אבל צריך לשים לב לעמודת הרישיון בכל שורה. חלק מהדוגמאות מגיעות תחת שיתוף זהה שמחייב להפיץ נגזרות באותו אופן, כך שאם אתם בונים מוצר קנייני סגור, כדאי לסנן מראש רק את הרשומות תחת CC BY 4.0.

האם יש במאגר שאלות או פתרונות בעברית?

לא. כל הבעיות נאספו מקהילות מקוונות באנגלית והפתרונות נוצרו באנגלית בלבד. אם אתם מכוונים למתמטיקה בעברית תצטרכו לתרגם את הנתונים או להוסיף מקורות מקומיים.

כמה מקום ומשאבים צריך כדי להוריד את הדאטהסט?

ההורדה עצמה לוקחת בערך 5.16 גיגה בייט של קובצי Parquet דחוסים. אם פורסים את המידע לטקסט לא דחוס מגיעים לכ־18.43 גיגה בייט, ובסך הכל יש בו מעל 6.3 מיליארד טוקנים.

איך אנבידיה וידאה שהפתרונות הסינתטיים נכונים?

התהליך הסתמך על השוואת התשובה הסופית שיצר המודל לתשובה הידועה מראש במאגר Nemotron-Math-v2. רק פתרונות שבהם הייתה התאמה מוחלטת נשמרו, בעוד שפתרונות שלא הגיעו לתוצאה הנכונה נזרקו.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face בלי צורך באישור גישה מיוחד. הקבצים שמורים בפורמט Parquet דחוס שמחולק ל־12 חלקים ושוקל 5.16 גיגה בייט בדיסק, אם כי פריסה לפורמט טקסטואלי מלא מגיעה ליותר מ־18 גיגה בייט ומעל שישה מיליארד טוקנים.

כל רשומה מכילה 14 עמודות קבועות. שדות המפתח לאימון הם messages שמחזיק את היסטוריית השיחה הרב שלבית, problem שמכיל את ניסוח השאלה, ו־expected_answer לאימות. אם אתם עובדים עם קריאות לקוד או פונקציות, עמודת tools מגדירה את הסכמה של הכלים.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-SFT-Math-v4")

הרישיון

המאגר מפוצל לשני רישיונות לפי מקור השאלה. חלק מהדוגמאות כפופות ל־CC BY 4.0 שמאפשר שימוש מסחרי חופשי עם מתן קרדיט בלבד. החלק שמקורו ב־Math StackExchange מופץ תחת CC BY-SA 4.0, רישיון שמחייב שיתוף זהה. אם תאמנו מודל על כל הדאטהסט ללא סינון החלק הזה, אתם עשויים להידרש להפיץ את הנגזרות באותם תנאים, ולכן לפרויקט מסחרי סגור כדאי לסנן לפי עמודת הרישיון.

הרישיון המלא ב־Hugging Face ↗