GPT
A

AceReason-1.1-SFT

קוד פתוח

nvidiacc-by-4.02025-06-16

  • nvidia
  • reasoning
  • math
  • code
  • supervised fine-tuning

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר ענק לאימון מודלים על חשיבה מתמטית וכתיבת קוד, שכולל כמעט ארבעה מיליון דוגמאות. כל התשובות בו נוצרו ישירות באמצעות DeepSeek-R1.

  • 2,963הורדות בחודש
  • 101לייקים

מה זה

המאגר מכיל 2,668,741 דוגמאות מתמטיקה לצד 1,301,591 דוגמאות קוד, ששימשו לאימון המודל AceReason-Nemotron-1.1-7B. הנתונים מתבססים על שאלות שנאספו משמונה מקורות שונים, כולל OpenMathReasoning, NuminaMath-CoT, OpenCodeReasoning, MagicoderEvolInstruct, opc-sft-stage2, leetcode, TACO ו־apps. רוב הנפח המתמטי מגיע מ־OpenMathReasoning שמספק מעל שני מיליון דוגמאות, בעוד שבתחום הקוד המקור הבולט ביותר הוא OpenCodeReasoning.

כל התשובות בכל הרשומות הופקו על ידי המודל DeepSeek-R1, כך שמדובר בפתרונות ארוכים שמציגים תהליכי חשיבה מפורטים ולא רק תשובות סופיות. הצוות ביצע סינון זיהום נתונים כדי למנוע דליפה למבחני ביצועים, והסיר כל דוגמה שהכילה חפיפה של 9-gram מול מבחני הערכה מקובלים במתמטיקה ובמדעי המחשב.

מתאים ל

  • אימון SFT למודלי היגיון

    כוונון עדין של מודלי שפה להסקה לוגית, פתרון בעיות מתמטיות מורכבות וכתיבת קוד.

  • הטמעת שרשראות חשיבה

    לימוד מודלים לייצר פתרונות מפורטים צעד אחר צעד בסגנון הפלטים של DeepSeek-R1.

  • סינון וזיקוק נתונים

    בניית תת-מאגרים ממוקדים על בסיס שאלות מ־leetcode, TACO או NuminaMath.

איפה זה נופל

התוכן מוגבל לאנגלית בלבד, ואין בו שום דוגמאות בעברית או בכל שפה אחרת. בנוסף, המאגר מיועד אך ורק למתמטיקה ותכנות ואין בו שום דאטה לשיחה כללית או למשימות טקסט שאינן קשורות להסקה לוגית. נקודה קריטית נוספת היא שכל התשובות הן פלט סינתטי של DeepSeek-R1, מה שאומר שהזיות, שגיאות היגיון נסתרות או סגנון חשיבה ספציפי של המודל הזה הועתקו ישירות אל תוך הנתונים.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן, הרישיון המוגדר הוא CC BY 4.0. הוא מאפשר שימוש מסחרי מלא כל עוד אתם מספקים ייחוס מתאים למחברים.

האם יש במאגר שאלות או פתרונות בעברית?

לא. המאגר מתועד כשפה האנגלית בלבד, וכל השאלות והפתרונות שנאספו מנוסחים באנגלית ובשפות תכנות שונות.

מאיפה הגיעו התשובות וההסברים שבדאטהסט?

השאלות נאספו ממאגרים קיימים כמו LeetCode, TACO ו־NuminaMath, אך כל התשובות נוצרו מחדש באמצעות המודל DeepSeek-R1. מדובר בדאטה סינתטי שמציג פתרונות מנומקים.

האם יש חשש מזיהום של מבחני ביצועים מוכרים?

היוצרים מדווחים שביצעו סינון ייעודי נגד זיהום נתונים. הם סילקו כל רשומה שהציגה חפיפה של 9-gram מול מבחני ההערכה המקובלים שלהם בתחומי המתמטיקה והקוד.

איך טוענים

הנתונים מחולקים ל־188 קבצי Arrow בתוך תיקיית sft_data.parquet, ללא צורך בהרשאת גישה מיוחדת או אישור מקדים מ־nvidia. אתם טוענים אותו ישירות בעזרת ספריית datasets הרגילה. קחו בחשבון שמדובר במאגר של כמעט ארבעה מיליון רשומות שמחזיקות טקסטים ארוכים, ולכן הורדה ועיבוד מקומי ידרשו נפח אחסון משמעותי וזיכרון עבודה מתאים.

from datasets import load_dataset

ds = load_dataset("nvidia/AceReason-1.1-SFT")

הרישיון

המאגר מופץ תחת רישיון CC BY 4.0 חופשי יחסית. הרישיון מאפשר שימוש מסחרי, עריכה ויצירת נגזרות, כולל אימון מודלים לצרכים פנימיים או למוצרים מסחריים, בתנאי שאתם מעניקים קרדיט מתאים ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗