GPT
N

Nemotron-SFT-Math-v3

קוד פתוח

nvidiacc-by-4.0,cc-by-sa-4.02026-03-08

  • math

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

המאגר מרכז 3,638,783 מסלולי פתרון מתמטיים שנוצרו על ידי מודלים, עם ובלי שימוש בקוד פייתון. הוא מיועד למי שרוצה לאמן מודלים על הסקת מסקנות מתמטית מורכבת שבה כל תשובה סופית אומתה במדויק.

  • 6,457הורדות בחודש
  • 43לייקים

מה זה

הנתונים מבוססים על בעיות מתוך המאגר Nemotron-Math-v2, שמקורן בקהילת AoPS ובפורומים של Math StackExchange ו־MathOverflow. עבור כל בעיה נוצרו פתרונות מרובים. שרשראות החשיבה הרגילות הופקו באמצעות DeepSeek-V3.2-Speciale, ואילו פתרונות שמשלבים הרצת קוד פייתון נוצרו עם DeepSeek-V3.2 דרך כלי NeMo-Skills. פתרונות נשמרו רק אם התשובה הסופית שלהם תאמה לתשובת הייחוס המאומתת.

המאגר כולל שני מקורות עיקריים שסוננו מראש. תת-הקבוצה של AoPS מכילה שאלות תחרותיות באלגברה, גיאומטריה, תורת המספרים וקומבינטוריקה, ללא שאלות הוכחה כדי לאפשר אימות תוצאה, ותוך סינון בעיות קלות מדי. תת-הקבוצה של StackExchange כוללת שאלות מתמטיות ברמה אקדמית, שגם מהן הוסרו שאלות הוכחה באמצעות מסווג מבוסס מודל שפה, ובוצע ניקוי למניעת חפיפה עם מבחני ביצועים פומביים.

מתאים ל

  • אימון מודל לפתרון עם קוד

    לימוד מודלים להריץ קוד פייתון כחלק מפתרון שלבי ביניים בבעיות חישוביות מורכבות.

  • שיפור שרשרת חשיבה מתמטית

    כוונון עדין על פתרונות מלאים ומאומתים באלגברה וקומבינטוריקה ללא שימוש בכלים חיצוניים.

  • מחקר על אסטרטגיות פתרון

    השוואת מסלולי חשיבה שונים לאותה בעיה מתמטית לבחינת יציבות הפלט של מודלי שפה.

איפה זה נופל

כל התוכן במאגר הוא באנגלית בלבד ואין בו שום תמיכה בעברית. המאגר לא כולל שאלות הוכחה כלל, מכיוון שהן סוננו החוצה במכוון כדי להשאיר רק בעיות עם תשובה סופית שניתן לבדוק אוטומטית, מה שמגביל אימון על הנמקה מתמטית תאורטית מלאה. בנוסף, חלק מהתשובות הסופיות הוחלפו בהצבעת רוב של פתרונות שנוצרו על ידי מודלים, כפי שמעיד השדה changed_answer_to_majority, כך שייתכנו שגיאות שנובעות מהסכמה שגויה בין מודלים. הפתרונות עצמם הם סינתטיים לחלוטין ונשענים על פלטים של משפחת DeepSeek-V3.2.

אותה משפחה

Nemotron-SFT-Math יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

הכרטיס מציין שהמאגר מיועד לשימוש מסחרי, אך הרישיון מחולק לפי מקור הנתונים. חלק מהרשומות מוגנות תחת CC BY 4.0 וחלק תחת CC BY-SA 4.0 המחייב שיתוף זהה. אם המוצר שלכם לא יכול לעמוד בדרישות ה־ShareAlike, תצטרכו להשתמש רק ברשומות שמקורן ב־AoPS.

כמה מקום צריך בשביל לעבוד עם הדאטהסט?

נפח האחסון הכולל של הקבצים על הדיסק עומד על כ־144 גיגה-בייט. מומלץ לוודא שיש לכם מספיק שטח אחסון מהיר וזיכרון עבודה מתאים לטעינה ועיבוד של קובצי JSONL בהיקף כזה.

האם הדאטהסט כולל תוכן בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל הבעיות והפתרונות שמקורם בקהילות כמו AoPS ו־StackExchange כתובים באנגלית.

איך נוצרו הפתרונות בדאטהסט?

הבעיות נלקחו מ־Nemotron-Math-v2, ועבורן הופקו פתרונות באמצעות DeepSeek-V3.2-Speciale להסבר טקסטואלי ו־DeepSeek-V3.2 לשילוב קוד פייתון. המערכת סיננה ושמרה רק פתרונות שהגיעו בדיוק לתשובת הייחוס הנכונה.

איך טוענים

המאגר מגיע כקובץ JSONL בודד בחלוקת train, ושוקל כ־144 גיגה-בייט על הדיסק, כך שצריך להיערך עם נפח אחסון משמעותי לפני ההורדה. אין דרישה לאישור גישה מיוחד. כל רשומה כוללת את השדות problem, expected_answer, ומערך messages שמסודר לשיחות אימון רב-שלביות עם תפקידי מערכת, משתמש, עוזר וכלי. בנוסף כדאי לשים לב לשדה tool_usage שמגדיר אם הפתרון משלב פייתון, ולשדה license שמשתנה ברמת הרשומה.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-SFT-Math-v3")

הרישיון

המאגר כולל רישיון כפול שתלוי במקור הרשומה, ומסומן בכל דוגמה בנפרד בשדה license. דוגמאות שמקורן ב־AoPS מפורסמות תחת CC BY 4.0 שמאפשר שימוש מסחרי עם מתן קרדיט. לעומת זאת, דוגמאות מ־StackExchange כפופות ל־CC BY-SA 4.0, שדורש שיתוף תחת אותו רישיון ומטיל מגבלות העתקה ושיתוף על תוצרים נגזרים. לפני אימון מודל מסחרי סגור, צריך לבדוק אם אתם יכולים להשתמש בחלק של ה־ShareAlike או שעליכם לסנן אותו החוצה.

הרישיון המלא ב־Hugging Face ↗