GPT
S

Superior-Reasoning-SFT-gpt-oss-120b

קוד פתוח

Alibaba-Apsaracc-by-4.02025-12-29

  • code
  • math
  • scientific-qa
  • instruction-following
  • reasoning

אוסף של 435 אלף דוגמאות שרשראות חשיבה ארוכות שזוקקו ממודל ענק. המטרה כאן היא ללמד מודלים קטנים לפתור בעיות מתמטיקה, מדע וקוד בלי לנפח את נפח האימון למיליוני רשומות.

  • 1,089הורדות בחודש
  • 351לייקים

מה זה

המאגר מכיל דוגמאות אימון שמחולקות לשני קבצים לפי שלבי עבודה שונים. השלב הראשון כולל כ־105 אלף דוגמאות שנוצרו בטמפרטורה נמוכה ומיועדות לייצוב המודל הלומד. השלב השני כולל כ־330 אלף דוגמאות שנוצרו בטמפרטורה גבוהה יותר, במטרה לחשוף את המודל למגוון רחב של מסלולי פתרון. כל רשומה כוללת מזהה ייחודי, שאלת קלט, פלט הכולל תגיות חשיבה ייעודיות, תחום ידע, ומטא-דאטה שמתעד את טמפרטורת הדגימה ושם מודל המקור.

השאלות עצמן לא נכתבו מאפס אלא נלקחו ממאגרים ציבוריים מוכרים של אנבידיה ודיפסיק, בהם AceReason, OpenCodeReasoning, OpenScienceReasoning ומאגר הזיקוק של DeepSeek-R1. המענה של מודל המקור עבר סינון שהסיר חזרות מיותרות וקטעים שנקטעו באמצע, לצד שיטת דגימה מבוססת התפלגות שנועדה להתאים את הרצפים ליכולת הקליטה של מודל קטן.

מתאים ל

  • אימון מודלי קוד ומתמטיקה

    לימוד מודלים קטנים להפיק שרשראות חשיבה מפורטות ומובנות בפתרון בעיות מדעיות.

  • הערכת עקביות הסקה

    בדיקת איכות שלבי הביניים של מודל מול מסלולי חשיבה מרובי צעדים באנגלית.

  • מחקר על זיקוק ידע

    ניתוח ההשפעה של טמפרטורות דגימה שונות על יציבות של מודל סטודנט.

איפה זה נופל

המאגר בנוי כולו באנגלית, ולכן אינו מתאים למי שמחפש לפתח מודל שיודע להסביר בעיות מורכבות בעברית. כל הנתונים מבוססים על פלטים סינתטיים של מודל יחיד, מה שאומר שהטיות, טעויות עובדתיות או עיוותי חשיבה של מודל המקור זולגים ישירות פנימה. בנוסף, המאגר מספק רק את שני שלבי האימון הראשונים ולא כולל את נתוני שלב התיקון העצמי שמוזכר בדוח הטכני, כך ששחזור מלא של השיטה דורש הפקה עצמית של נתונים נוספים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מודל מסחרי?

כן, רישיון המקור הוא CC BY 4.0 שמתיר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט ראוי לחוקרים שפרסמו את המאגר.

האם יש בדאטהסט נתונים או שאלות בעברית?

לא, המאגר כולו מוגדר ופועל באנגלית בלבד. אם המטרה שלכם היא מודל שמנמק בעברית, תצטרכו לתרגם את השאלות או לפנות למקורות אחרים.

מה ההבדל בין קובץ שלב 1 לקובץ שלב 2?

השלב הראשון כולל כ־105 אלף דוגמאות שנוצרו בטמפרטורה נמוכה ונועדו לייצב את יכולת ההסקה של המודל. השלב השני כולל כ־330 אלף דוגמאות בטמפרטורה גבוהה יותר שנועדו להוסיף מגוון לחשיבה.

מאיפה הגיעו השאלות שבמאגר?

השאלות נאספו ממאגרים פתוחים קיימים של אנבידיה ושל צוות דיפסיק, בתחומי מתמטיקה, קוד ומדע. התשובות ושלבי החשיבה עצמם נוצרו מחדש באמצעות מודל gpt-oss-120b.

איך טוענים

הנתונים שמורים בשני קבצי JSONL פשוטים, אחד לכל שלב, ואין צורך לבקש אישור גישה מיוחד כדי להוריד אותם מהמאגר. טוענים אותם ישירות באמצעות ספריית הדאטהסטים הרגילה של הגינג פייס. השדות החשובים לעבודה הם שאלת הקלט ותשובת המודל שכוללת את שלבי החשיבה המלאים. אם אתם רוצים לשחזר במדויק את מתכון האימון של החוקרים, תצטרכו להריץ קודם אימון על קובץ השלב הראשון ורק אז להמשיך לקובץ השני.

from datasets import load_dataset

ds = load_dataset("Alibaba-Apsara/Superior-Reasoning-SFT-gpt-oss-120b")

הרישיון

הנתונים שוחררו תחת רישיון CC BY 4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של המאגר, כל עוד אתם נותנים קרדיט מתאים ליוצרים המקוריים ומציינים אם נעשו שינויים. אין חובה לשתף מודלים שתאמנו על הנתונים תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗