GPT
O

OpenMathReasoning

קוד פתוח

nvidiacc-by-4.02025-04-22

  • math
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר ענק לאימון מודלי חשיבה מתמטית עם מיליוני פתרונות מפורטים. הוא מתאים למי שרוצה לשחזר ביצועים של תחרויות אולימפיאדה בלי לייצר שרשראות חשיבה מאפס.

  • 74,141הורדות בחודש
  • 474לייקים

מה זה

המאגר כולל 306 אלף בעיות מתמטיות ייחודיות שמקורן בפורומים של AoPS, ועליהן נבנו כחמישה וחצי מיליון פתרונות שונים. הפתרונות מתחלקים לשלושה סוגים: 3.2 מיליון שרשראות חשיבה ארוכות, 1.7 מיליון פתרונות משולבי כלים שכוללים קוד, ועוד 566 אלף דוגמאות לבחירת הפתרון המבטיח ביותר מתוך כמה מועמדים. יש בו גם קובץ נפרד של 193 אלף בעיות ללא פתרונות.

איסוף הנתונים התחיל מסריקה של פורומי AoPS וקבוצה קטנה של דוגמאות ממאגר MATH. השאלות עברו עיבוד מקדים וניסוח מחדש בעזרת Qwen2.5-32B-Instruct. את הפתרונות עצמם ייצרו בצורה סינתטית דרך המודלים DeepSeek-R1 ו־QwQ-32B, כך שמדובר בדאטה סינתטי שמבוסס על שאלות אנושיות מקוריות.

מתאים ל

  • אימון SFT למתמטיקה

    אימון מודלי שפה על שרשראות חשיבה ארוכות כדי לשפר ביצועים במבחנים מתמטיים.

  • שילוב קוד בפתרון בעיות

    שימוש במיליון ושבע מאות אלף דוגמאות TIR כדי ללמד מודל להריץ פייתון בזמן הסקת מסקנות.

  • אימון מודלי דירוג ובחירה

    שימוש בחלק ה־GenSelect כדי לאמן מודל לבחור את התשובה הנכונה מבין כמה פלטים אפשריים.

איפה זה נופל

כל הפתרונות סינתטיים לחלוטין ונוצרו על ידי מודלים, מה שמשאיר סיכון להזיות לוגיות עדינות בתוך שרשראות החשיבה. המאגר מוגבל לאנגלית בלבד, ואין בו שום תמיכה בשפות אחרות או בעברית. בנוסף, הצוות הודה שאיבד 137 אלף שאלות הוכחה בגלל באג בתהליך העיבוד, וכשהם החזירו אותן הביצועים באימון ירדו, כך שהמאגר הנוכחי מסנן כמעט לגמרי שאלות שדורשות הוכחות גיאומטריות או אלגבריות טהורות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוגדר הוא cc-by-4.0 שמתיר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט נאות ליוצרי המאגר. אין חובה לחשוף את המשקולות של המודל שתאמנו עליו.

האם יש במאגר בעיות מתמטיות בעברית?

לא. המאגר מוגדר ומכיל טקסטים באנגלית בלבד, מתוך פורומים בינלאומיים של קהילת AoPS ומאגר MATH. אם אתם צריכים תמיכה בעברית, תצטרכו לתרגם את השאלות והפתרונות בעצמכם.

איך נוצרו הפתרונות לבעיות?

השאלות נלקחו מפורומי AoPS ועברו שכתוב על ידי Qwen2.5-32B-Instruct. לאחר מכן, הפתרונות יוצרו באופן סינתטי באמצעות המודלים DeepSeek-R1 ו־QwQ-32B בשני אופנים עיקריים, שרשראות חשיבה טקסטואליות ופתרונות שמשלבים כתיבת קוד.

למה מספר הבעיות נמוך ממה שדווח בהתחלה?

במקור דווח על 540 אלף בעיות, אך המספר הזה ייצג את תחילת התהליך. סינון שאלות רב ברירה ושאלות כן ולא, בדיקות למניעת זליגת מבחני הערכה, ובאג שגרם לאובדן שאלות הוכחה צמצמו את המאגר הסופי ל־306 אלף בעיות עם פתרונות.

איך טוענים

הנתונים יושבים במאגר פתוח ללא צורך באישור גישה מוקדם, ומחולקים ל־234 קבצי Parquet. כדי לעבוד איתם ביעילות מומלץ לטעון רק את החלקים הרלוונטיים למשימה שלכם, כמו פיצול ה־cot או ה־tir. השדות המרכזיים שתרצו לבדוק הם הטקסט המעובד של השאלה, הפתרון שנוצר, המודל שיצר אותו, וסוג הבעיה שמציין אם התשובה הסופית חולצה בוודאות או נקבעה לפי רוב.

from datasets import load_dataset

ds = load_dataset("nvidia/OpenMathReasoning")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ומחייב רק מתן קרדיט מתאים ליוצרים. אין כאן דרישה לשתף תוצרי מודלים תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗