GPT
N

NuminaMath-1.5

קוד פתוח

AI-MOapache-2.02025-02-10

  • math
  • post-training

מאגר לאימון מודלים על כמעט 900 אלף בעיות מתמטיות ברמת תחרויות ובגרות, כולל פתרונות שרשרת מחשבה מלאים. הוא מספק מטא-דאטה מובנה של תשובות סופיות וסיווג לפי נושאים שמאפשרים אימות אוטומטי.

  • 36,120הורדות בחודש
  • 193לייקים

מה זה

המאגר מכיל 896,215 שאלות מתמטיות עם פתרונות מפורטים בשיטת שרשרת מחשבה. המקורות נעים בין תרגילי תיכון מסין, דיונים מפורום AoPS, ועד בעיות מתחרויות אולימפיאדה בינלאומיות ומבחני AMC ו־AIME בארצות הברית. לצד חומרים מבוססי תחרויות, נכללים בו גם מאגרי תרגול כמו Orca Math, MetaMath ונתונים סינתטיים.

האיטרציה הזו הוסיפה מטא-דאטה מוגדר היטב לכל בעיה: סוג התוכן כמו אלגברה, גאומטריה, תורת המספרים או קומבינטוריקה, סוג השאלה כשאלת הוכחה, רב-ברירה או בעיה מילולית, ושדה תשובה סופית. עבור בעיות בעלות ערך מספרי השדה מחזיק את התוצאה, ועבור הוכחות או תשובות שלא חולצו הוא מסומן בהתאם, מה שמקל על בדיקה שיטתית.

מתאים ל

  • אימון מודל פתרון בעיות

    כוונון מודלי שפה על שרשרת מחשבה מתמטית ברמת תיכון ותחרויות בינלאומיות.

  • סינון והערכת ביצועים

    בדיקת דיוק של מודלים מול שדה התשובה הסופית בבעיות חישוביות.

  • מיון לפי נושאים

    בניית תתי-מאגרים ממוקדים בתחומים ספציפיים כמו גאומטריה או תורת המספרים.

איפה זה נופל

כל הטקסט באנגלית בלבד, ואין כאן נתונים בעברית. חלק משמעותי מהחומר מגיע מפענוח אוטומטי של קובצי PDF וסריקות באמצעות רגקס ומודלי שפה, מה שמייצר שגיאות חילוץ בחלק מהשאלות. היוצרים הודו שנתונים סינתטיים פגעו בביצועים ולכן הסירו את synthetic_amc, אך המאגר עדיין מכיל כ־150 אלף דוגמאות מ־synthetic_math. בנוסף, אם שדה התשובה קיבל ערך notfound, הפתרון אינו שלם ולא מאפשר בדיקה אוטומטית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא Apache 2.0, ולכן אין מניעה חוקית לאמן עליו מודלים מסחריים או לשלב אותו במערכות פנימיות. התנאי היחיד הוא שמירה על זכויות היוצרים והודעת הרישיון המקורית של הפרויקט.

האם יש במאגר שאלות בעברית?

לא. השפה המוגדרת במאגר היא אנגלית בלבד. חלק מהשאלות תורגמו ממבחנים סיניים או בינלאומיים, אך כל הטקסט הסופי מוצג באנגלית.

מה ההבדל בין הגרסה הזו לגרסאות הקודמות של NuminaMath?

נוספו שדות מטא-דאטה מובנים של סוג השאלה, תחום מתמטי ותשובה סופית לאימות. בנוסף, בוצע תיקון ידני של בעיות אולימפיאדה רבות כדי להתגבר על כשלים של פיענוח אוטומטי, והוסר החלק של synthetic_amc שהוריד מאיכות התוצאות.

איך נאספו הפתרונות והשאלות?

החומר הגיע מקובצי PDF של בחינות, אתרי תחרויות רשמיים ופורומים מקוונים כמו AoPS. חלק מהנתונים עברו חילוץ אוטומטי, בעוד שחלקים מסוימים עברו עיבוד ואימות ידני על ידי שותפי הפרויקט.

איך טוענים

הנתונים יושבים בשלושה קבצי Parquet בתוך תיקיית data ומחולקים לפי קבוצת אימון יחידה. המאגר פתוח לציבור ללא צורך באישור גישה מראש. כדי לעבד אותו נכון, כדאי לשים לב לשדות problem_type, question_type ו־answer, שמפרידים בין הוכחות לבין שאלות חישוביות שבהן יש תוצאה חד-משמעית להשוואה.

from datasets import load_dataset

ds = load_dataset("AI-MO/NuminaMath-1.5")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי ומחקר חופשי. מותר לשנות את הנתונים, להפיץ אותם מחדש ולאמן עליהם מודלים מסחריים, כל עוד שומרים על הודעת הרישיון וקרדיט למפתחים המקוריים. אין דרישה לפתוח את הקוד של מודל שאומן עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗