GPT
A

AceReason-Math

קוד פתוח

nvidiacc-by-4.02025-06-02

  • math
  • reasoning

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר של 49 אלף בעיות מתמטיקה מורכבות עם פתרונות שניתנים לאימות. אנבידיה יצרה אותו במיוחד לאימון מודלי חשיבה באמצעות למידת חיזוק.

  • 3,728הורדות בחודש
  • 57לייקים

מה זה

המאגר כולל 49 אלף רשומות של בעיות מתמטיקה ממוקדות יחד עם תשובות סופיות. הנתונים לא נכתבו מאפס, אלא נאספו משני מקורות קיימים ומוכרים בתחום, NuminaMath וגרסת התצוגה המקדימה של DeepScaler. המטרה של המפרסמים הייתה לייצר סט נקי שמתאים ספציפית ללמידת חיזוק, ולכן הוא עבר תהליך סינון אגרסיבי.

במהלך הסינון הוצאו שאלות שאינן מתאימות לתהליך בדיקה אוטומטי. הוסרו שאלות אמריקאיות עם בחירה מרובה, שאלות נכון או לא נכון, משימות הדורשות הוכחה מלאה, שאלות עם סעיפי משנה מרובים, ובעיות שכוללות תמונות ושרטוטים. כמו כן נפסלו תשובות ארוכות ומסובכות מדי שקשה לאמת באופן ישיר. הנתונים שימשו לאימון מודלי AceReason-Nemotron של אנבידיה שהציגו תוצאות חזקות במבחני AIME.

מתאים ל

  • אימון בלמידת חיזוק

    שימוש בבעיות ובפתרונות הסופיים כבסיס לתגמול מודלים בתהליכי RL על הנמקה מתמטית.

  • הערכת ביצועי מודלים

    בדיקת יכולת הפתרון של מודלי שפה על שאלות מתמטיקה ברמת תחרויות כמו AIME.

  • כיוונון עדין למתמטיקה

    אימון מודל שפה קיים לשיפור הדיוק בהגעה לתוצאה מתמטית סופית ונכונה באנגלית.

איפה זה נופל

כל התוכן כתוב באנגלית בלבד ואינו כולל שום ייצוג לעברית או לשפות אחרות. מאחר שהסינון הוציא לחלוטין שאלות עם שרטוטים, הוכחות גיאומטריות ומבנים מורכבים, אי אפשר להשתמש בו לאימון מודלים מולטימודליים או לבעיות הדורשות הנמקה גיאומטרית ויזואלית. הנתונים מוגבלים למבנה שבו יש תשובה חד משמעית שניתן לבדוק בקוד, ולכן מודל שמתאמן עליהם עלול להתקשות במשימות פתוחות יותר שדורשות שיח או ניסוח טיעונים רציפים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא cc-by-4.0 שמתיר שימוש מסחרי חופשי לחלוטין. החובה היחידה שלכם היא להעניק קרדיט נאות ליוצרים ולציין קישור לרישיון.

האם הדאטהסט כולל שאלות בעברית?

לא, המאגר מוגדר וכולל נתונים בשפה האנגלית בלבד. אם המוצר שלכם פונה לתלמידים בישראל, תצטרכו לתרגם את השאלות או להוסיף מקורות מקומיים.

איך נאספו השאלות במאגר?

הנתונים נלקחו ממאגרי NuminaMath וגרסת התצוגה של DeepScaler. אנבידיה סיננה מתוכם שאלות עם תמונות, הוכחות ותשובות ארוכות כדי להשאיר רק בעיות שניתן לאמת אוטומטית.

מה ההבדל בינו לבין המאגרים שמהם הוא נלקח?

ההבדל המרכזי הוא הניקוי הממוקד. במקום מאגר ענק ומעורב, כאן הוצאו שאלות אמריקאיות, בעיות רב-שלביות ושאלות שדורשות ראייה ממוחשבת, כדי להתאים ישירות לאימון במודל תגמול.

איך טוענים

הנתונים מגיעים בקובץ math.jsonl פשוט ופתוח להורדה ישירה דרך ספריית datasets או בטעינת קבצי jsonl רגילה, ללא צורך בהרשמה או בבקשת גישה מיוחדת מאנבידיה. המאגר מכיל רק ארבעה קבצים בסך הכל ואינו דורש משאבי אחסון כבדים. לפני שרצים לאימון, כדאי לשים לב שהפורמט מיועד לחילוץ פשוט של הבעיה והפתרון הסופי, כך שתוכלו לחבר אותו מיד למערכות שבודקות תשובות מתמטיות באופן אוטומטי.

from datasets import load_dataset

ds = load_dataset("nvidia/AceReason-Math")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש מסחרי ומחקרי מלא, כולל שינוי הנתונים ואימון מודלים עליהם, בתנאי שאתם נותנים קרדיט מתאים ליוצרים ומציינים אם נעשו שינויים. אין דרישה לשתף את המודל המאומן או את הנגזרות תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗