GPT
S

Superior-Reasoning-SFT-gpt-oss-120b-Logprob

קוד פתוח

Alibaba-Apsaracc-by-4.02025-12-28

  • code
  • math
  • scientific-qa
  • instruction-following
  • reasoning

המאגר כולל הסתברויות ברמת הטוקן שחולצו ממודל ענק עבור מאות אלפי שרשראות חשיבה. הוא מיועד לזיקוק ידע מתקדם ואימון מודלים קטנים ביעילות גבוהה.

  • 3,132הורדות בחודש
  • 63לייקים

מה זה

המאגר הזה הוא חצי מחבילה שלמה. הוא לא מכיל טקסט גולמי של שאלות או תשובות, אלא רק את מזהי הטוקנים וההסתברויות המתאימות להם שנשמרו ישירות ממודל המורה gpt-oss-120b. כל רשומה מייצגת פתרון חשיבה ארוך, ומכילה שלושה שדות בלבד: מזהה ייחודי, רשימת מספרים של הטוקנים, ורשימת ציוני ההסתברות של המודל לכל נקודה ברצף.

הנתונים מחולקים למסלולים כמו קוד ומשימות חשיבה מורכבות, ומשמשים לפי הדוח הטכני לאימון מודלים בשני שלבים, בטמפרטורה נמוכה וגבוהה. החיבור לטקסט המקורי נעשה דרך מזהה הדגימה, שמצליב כל רשומה מול מאגר הטקסט הראשי של הפרויקט. מדובר בחלק משיטה שנועדה ליישר את התפלגות הפלטים של המודל הלומד מול המורה בזמן זיקוק רצפים.

מתאים ל

  • זיקוק מודלי שפה

    אימון מודלים קטנים על התפלגות ההסתברויות המלאה של מודל מורה חזק.

  • אימון יכולות חשיבה בקוד

    שחזור ביצועי חשיבה מורכבים במודלי 4B ו־30B באמצעות נתוני השלב הראשון.

  • מחקר על התפלגות טוקנים

    ניתוח רמות הביטחון וההיסוס של מודלי שפה גדולים בעת פתרון בעיות מתמטיות.

איפה זה נופל

זהו מאגר מספרים עיוור שאינו מכיל מילים, ולכן אי אפשר לסנן ממנו תכנים בלי המאגר הראשי. הטוקנים מתאימים אך ורק למילון הספציפי של המודל המקורי, והם באנגלית בלבד. עברית לא קיימת כאן, וכל ניסיון להשתמש בזה למודל בעל ארכיטקטורה שונה ידרוש התאמות כבדות.

שאלות
נפוצות

האם אפשר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא CC-BY-4.0 ומאפשר שימוש מסחרי מלא. צריך רק להקפיד על מתן קרדיט לצוות הפיתוח שפרסם אותו.

האם יש כאן שאלות ותשובות בעברית?

לא. הנתונים מקודדים כטוקנים באנגלית בלבד ואינם כוללים טקסט בעברית.

למה אי אפשר לעבוד עם המאגר הזה לבד?

המאגר מכיל רק מספרים של טוקנים והסתברויות ולא את הטקסט הקריא. כדי להבין מה השאלה והתשובה, חייבים לחבר אותו למאגר הראשי באמצעות שדה המזהה.

איך הנתונים האלה נוצרו בפועל?

חוקרי עליבאבא הריצו מודל בגודל 120 מיליארד פרמטרים על דוגמאות חשיבה. בזמן הריצה הם שמרו את ערכי ההסתברות המדויקים שהמודל חישב עבור כל טוקן ברצף.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטס הרגילה בפייתון או בקריאה ישירה של קובצי פרקט. המאגר מפוצל ל־908 קבצים, כולל חלוקה לתיקיות של שלבי אימון ותחומים שונים, כך שאין צורך באישור גישה מיוחד כדי להתחיל להוריד. השדות המרכזיים שחובה למפות הם המזהה הייחודי, רשימת הטוקנים והציונים המספריים שלהם. צריך לקחת בחשבון שאי אפשר לעשות עם הקבצים האלה כלום לבד, וחייבים להוריד במקביל את מאגר הטקסט הראשי כדי להצליב ביניהם בעזרת אותו מזהה.

from datasets import load_dataset

ds = load_dataset("Alibaba-Apsara/Superior-Reasoning-SFT-gpt-oss-120b-Logprob")

הרישיון

הרישיון הוא קריאייטיב קומונס 4.0 מסוג ייחוס. מותר להשתמש בנתונים למטרות מסחריות ולמחקר, לשנות אותם ולשלב אותם בכל מוצר. התנאי היחיד הוא לתת קרדיט ברור ליוצרים על פי הדוח הטכני שלהם. אין דרישה לפתוח את המודלים שתאמנו או לשתף את הקוד תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗