GPT
O

ODA-Math-460k

קוד פתוח

OpenDataArenacc-by-nc-4.02025-12-16

  • math
  • reasoning

אוסף של כארבע מאות ושישים אלף שאלות מתמטיות עם פתרונות מלאים שנוצרו בידי מודל ועברו אימות קפדני. המאגר נבנה בדיוק עבור מי שמחפש בעיות מאתגרות ולא טריוויאליות לאימון מודלי חשיבה.

  • 422הורדות בחודש
  • 104לייקים

מה זה

המאגר כולל כ־460 אלף דוגמאות בפורמט קבוע של שאלה, שרשרת פתרון מפורטת בשלבים ותשובה סופית. הנתונים מתמקדים בבעיות מתמטיות פתוחות עם תשובה מספרית או חד-משמעית שאפשר לבדוק באופן אוטומטי. אלגברה תופסת כמעט מחצית מהדוגמאות עם 44.8 אחוזים, גיאומטריה תופסת בין עשרים לעשרים ושניים אחוזים, והיתר מחולק שווה בשווה בין חשבון אינפיניטסימלי, קומבינטוריקה והסתברות, ותורת המספרים.

הבסיס נאסף מתוך מאגרי קוד פתוח מובילים כמו ScaleQuest-Math, NuminaMath-CoT ו־OpenMathInstruct-2, מתוך מאגר גולמי ראשוני של 11.4 מיליון שאלות. תהליך הסינון כלל ניקוי כפילויות, הסרת חפיפות למבחני ביצועים מקובלים, ופסילת שאלות אמריקאיות, שאלות נכון או לא נכון ושאלות הוכחה באמצעות כלי Big Math.

הבחירה הסופית התבססה על מבחני קושי מול מודלים קיימים. היוצרים השמיטו שאלות ש־Qwen3-8B פתר בקלות בלי שלבי חשיבה, ופסלו בעיות שאפילו Qwen3-30B-A3B לא הצליח לפתור עם חשיבה. את הפתרונות עצמם זיקקו מהמודל AM-Thinking-v1 ואישרו נקודתית באמצעות Compass-Verifier-7B מול תשובת המקור.

מתאים ל

  • אימון מודלי חשיבה

    כוונון עדין למודלים פתוחים כדי לשפר הפקת שלבי חשיבה בפתרון מתמטיקה.

  • הכנה לתחרויות

    תרגול על שאלות ברמת קושי של מבחני תחרות כמו AIME ואולימפיאדות.

  • אימון בודקי פתרונות

    שימוש בפתרונות המאומתים כדי ללמד מודלים לזהות צעדי פתרון נכונים.

איפה זה נופל

המאגר בנוי כולו באנגלית בלבד ואין בו שום ייצוג לעברית. אם המטרה היא מודל שיפתור בעיות מילוליות בעברית, הנתונים האלה לא יעזרו בלי תרגום והתאמה. בנוסף, כל בעיות ההוכחה, שאלות הבחירה המרובה ושאלות נכון או לא נכון נופו בכוונה, כך שהמודל שתאמנו לא ילמד לנסח טיעונים לוגיים מורכבים שאינם מסתיימים בערך סופי. קיים גם סיכון להטיות מובנות שמגיעות ממודל המורה ומבודק התשובות, שניהם מודלים מלאכותיים, לצד חשש מדליפה של מבחני ביצועים פרטיים שלא זוהו בסינון הראשוני.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא. הרישיון הוא cc-by-nc-4.0, מה שאומר שהשימוש מוגבל למחקר ולמטרות לא מסחריות בלבד. אי אפשר לאמן עליו מודל שיימכר ללקוחות או יפעל בתוך מוצר רווחי.

האם יש במאגר שאלות בעברית?

אין שום תוכן בעברית. כל הבעיות ושרשראות הפתרון כתובות באנגלית בלבד. אם צריך תמיכה בעברית, תידרשו לתרגם את השאלות או לשלב מאגר נוסף.

איך סוננו התשובות הלא נכונות?

היוצרים יצרו חמישה פתרונות אפשריים לכל בעיה בעזרת AM-Thinking-v1 ובדקו אותם עם Compass-Verifier-7B מול תשובת האמת. רק זוגות של בעיה ופתרון שאושרו כנכונים נכנסו לקובץ הסופי.

במה המאגר הזה שונה מסתם אוסף שאלות מ־NuminaMath או מקורות אחרים?

הוא מתמקד ברמת קושי מסוימת שנופתה באמצעות מודלים, כך שאין בו שאלות טריוויאליות או שאלות שאינן פתירות. בנוסף, סוננו ממנו שאלות הוכחה ושאלות אמריקאיות כדי להשאיר רק בעיות שניתנות לאימות ברור.

איך טוענים

המאגר זמין להורדה ישירה ללא צורך בהרשמה מיוחדת או באישור גישה. הנתונים מחולקים לחמישה קובצי parquet תחת תיקיית data, החל מ־train-00000-of-00004 ועד train-00004-of-00004, כך שאפשר לטעון אותם בקלות בספריית datasets של Hugging Face בלי לנהל הורדות ידניות של קבצים שלמים. המבנה מבוסס על שדות של בעיה, שרשרת פתרון ותשובה סופית. כדאי לשים לב שבמאגר יש כ־460 אלף רשומות, כך שהאימון עליו דורש משאבי חישוב של ממש לסבבי כוונון עדין, ולא מדובר בקובץ דגימה קטן לבדיקות מהירות על המחשב המקומי.

from datasets import load_dataset

ds = load_dataset("OpenDataArena/ODA-Math-460k")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0 שמיועד למחקר ולשימוש אישי בלבד. אסור להשתמש בנתונים האלה כדי לאמן מודלים שמשולבים במוצרים מסחריים, בשירותים בתשלום או בפעילות עסקית כלשהי. השימוש דורש מתן קרדיט מלא ליוצרים, ואם אתם בונים על המאגר כדי לפתח כלי פנימי לחברה, הרישיון חוסם את זה לחלוטין.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗