GPT
R

R1-Distill-SFT

קוד פתוח

ServiceNow-AIcc-by-nc-sa-4.02025-01-25

מאגר נתוני אימון שזוקק ישירות מהמודל DeepSeek-R1-32b כדי לשחזר יכולות חשיבה. הוא מתאים למי שרוצה לאמן מודל פתוח על שרשראות חשיבה בלי לייצר דאטה סינתטי מאפס.

  • 1,895הורדות בחודש
  • 323לייקים

מה זה

המאגר מכיל פלטים שנוצרו על ידי הרצת מודל DeepSeek-R1-32b על גבי שאלות שנלקחו מהמאגרים Numina-math ו־Tulu. עבור כל פרומפט נדגמה תשובה אחת בלבד, במטרה לייצר נתוני כוונון עדין שמלמדים מודלים קטנים יותר לחשוב ולפתור בעיות מורכבות שלב אחר שלב.

הנתונים מחולקים לגרסאות לפי קבצי הפרקט במאגר. הגרסה הראשונה כללה סט ראשוני של 170,000 דוגמאות שמחולק לשלושה קבצים, והגרסה השנייה כוללת מאגר לא מסונן ולא מאומת של כ־2 מיליון דוגמאות שמתפרס על פני עשרות קבצים. היוצרים תכננו לשחרר בהמשך גם גרסה מסוננת ומאומתת, לצד מודלים מאומנים, אך בגרסה הנוכחית הנתונים מוצגים ללא בדיקות איכות מוקדמות.

מתאים ל

  • אימון מודל חשיבה

    כוונון עדין של מודלי שפה פתוחים על שרשראות חשיבה במתמטיקה ופתרון בעיות כלליות באנגלית.

  • מחקר על זיקוק ידע

    בדיקת השפעת זיקוק מפלט של DeepSeek-R1-32b לעומת אימון ישיר על נתונים אנושיים.

  • השוואת סינון נתונים

    פיתוח אלגוריתמים לסינון ובקרת איכות על גבי 2 מיליון דוגמאות גולמיות ולא מאומתות.

איפה זה נופל

הגרסה הגדולה במאגר מוגדרת במפורש כלא מסוננת ולא מאומתת. אין פה בקרת איכות על התשובות, והמודל המזקק עלול לייצר הזיות או שרשראות חשיבה שגויות לחלוטין בלי שאיש בדק אותן. בנוסף, המקורות הם Numina-math ו־Tulu באנגלית בלבד. מי שבונה על עברית לא ימצא פה שום דבר רלוונטי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי בחברה?

לא. הרישיון הוא cc-by-nc-sa-4.0 שמונע במפורש כל שימוש מסחרי. מעבר לכך, סעיף השיתוף הזהה מחייב אתכם לשחרר כל תוצר או מודל שתאמנו תחת אותו רישיון פתוח ולא מסחרי.

האם יש בדאטהסט תמיכה בעברית?

אין במאגר עברית כלל. כל הפרומפטים מגיעים ממאגרי Tulu ו־Numina-math שהם באנגלית, והתשובות שזוקקו מהמודל נוצרו באנגלית בלבד. אם המטרה שלכם היא מודל שמבין עברית, הדאטה הזה לא יעזור.

מאיפה הגיעו הנתונים ואיך אספו אותם?

החוקרים לקחו שאלות קיימות משני מקורות מוכרים, Numina-math ו־Tulu, והריצו עליהן את המודל DeepSeek-R1-32b. עבור כל שאלה הם שמרו תשובה אחת בלבד, ללא דגימות מרובות וללא בדיקה אנושית.

האם הנתונים עברו בדיקת איכות ואימות?

לא, כרטיס המאגר מציין בפירוש שגרסת שני מיליון הדוגמאות אינה מסוננת ואינה מאומתת. הצוות הצהיר על כוונה להוציא גרסה מסוננת בהמשך, אבל נכון לעכשיו הקבצים מכילים את הפלטים הגולמיים כפי שנפלטו מהמודל.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה של המאגר. אין כאן שום צורך לבקש אישור גישה מוקדם או למלא טופס, הקבצים פתוחים להורדה מיידית. הנתונים מחולקים לקבצי parquet בתוך התיקיות v0 ו־v1, בסך הכל 57 קבצים במאגר. בגלל שמדובר בכ־2 מיליון דוגמאות בגרסה המורחבת, רצוי לטעון קודם את גרסת הבסיס v0 שכוללת 170,000 דוגמאות כדי לבדוק את המבנה לפני שמושכים עשרות קבצים.

from datasets import load_dataset

ds = load_dataset("ServiceNow-AI/R1-Distill-SFT")

הרישיון

הרישיון הוא cc-by-nc-sa-4.0. המשמעות ברורה וסגורה: אסור כל שימוש מסחרי, חובה לתת קרדיט ליוצרים, וכל עבודה נגזרת או מודל שמאמנים על הנתונים האלה חייבים להתפרסם תחת אותו רישיון בדיוק. מודל שתאמנו על הדאטהסט הזה לא יוכל להימכר או לשרת מוצר בתשלום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗