GPT
A

AM-DeepSeek-R1-Distilled-1.4M

קוד פתוח

a-m-teamcc-by-nc-4.02025-03-09

  • code
  • math
  • reasoning
  • thinking
  • deepseek-r1

המאגר מרכז מיליון וארבע מאות אלף דוגמאות חשיבה באנגלית ובסינית שזוקקו ממודלים חזקים. הוא מיועד למי שרוצה לאמן מודל מוסק בלי לשלם על הפקת שרשראות חשיבה מאפס.

  • 1,845הורדות בחודש
  • 183לייקים

מה זה

הנתונים מחולקים לשני קבצים עיקריים לפי מקור התשובות. הקובץ הראשון מכיל כחצי מיליון רשומות שנאספו ישירות ממאגרי קוד פתוח מוכרים כמו KodCode ו־Dolphin R1. הקובץ השני כולל תשע מאות אלף רשומות שנוצרו על ידי הצוות באמצעות זיקוק ישיר ממודל DeepSeek-R1 בגרסת 671B.

כל רשומה בנויה ממערך הודעות בין משתמש לעוזר. התשובות כוללות תגיות מסודרות של תהליך חשיבה ושל הפתרון הסופי, לצד שדות מטא-דטא עם מקור השאלה, תשובות ייחוס למתמטיקה ולמדעים, וטסטים לבעיות קוד.

איסוף ההוראות התבסס על מודל שפה שדירג קושי וקטגוריות כדי לסנן משימות פשוטות מדי. לאחר מכן בוצע ניקוי כפילויות סמנטי כדי למנוע חזרות, ותשובות הקוד אומתו בסביבת ארגז חול יחד עם סינון באמצעות מודל תגמול.

מתאים ל

  • אימון שרשראות חשיבה

    לימוד מודלים קטנים לייצר תגיות חשיבה ופתרונות מפורטים בבעיות מורכבות.

  • בניית מודלי קוד

    שימוש ברשומות תכנות שעברו בדיקה בטסטים כדי לשפר יכולת כתיבת קוד.

  • מחקר זיקוק ידע

    בדיקת השפעת זיקוק ממודל ענק כמו DeepSeek-R1 מול דאטהסטים פתוחים אחרים.

איפה זה נופל

אין כאן עברית כלל, המאגר מוגבל לאנגלית ולסינית בלבד. היוצרים מציינים במפורש שהנתונים נוצרו על ידי מודלי שפה ולא עברו אימות אנושי קפדני, כך שיש בהם שגיאות עובדתיות והזיות שעלולות לעבור למודל שלכם.

בנוסף, בגלל שרשור מקורות בין מאגרי קוד פתוח שונים, הייחוס של חלק מההוראות אינו מדויק. אם המטרה שלכם היא מודל מדויק עובדתית, תצטרכו להריץ סינון ובדיקות עצמאיות על הפלטים לפני האימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC-BY-NC-4.0 והיוצרים מדגישים בפירוש שהנתונים והמודלים שמאומנים עליהם מיועדים למחקר בלבד. שימוש מסחרי אסור.

האם יש בדאטהסט שאלות או תשובות בעברית?

לא. המאגר כולל אך ורק נתונים באנגלית ובסינית, שמקורם בעיקר ממאגרי חשיבה וקוד בינלאומיים.

מה ההבדל בין קובץ ה־0.5M לקובץ ה־0.9M?

חצי מיליון הרשומות מגיעות מדאטהסטים קיימים בקוד פתוח כמו KodCode ו־Dolphin. לעומת זאת, תשע מאות אלף הרשומות האחרות כוללות תשובות שצוות המאגר הפיק ישירות ממודל DeepSeek-R1-671B.

באיזה פורמט הקבצים מגיעים ואיך פותחים אותם?

הקבצים שמורים בפורמט jsonl.zst. יש להתקין את כלי הכיווץ zstd כדי לחלץ אותם לקובץ jsonl רגיל, או לטעון אותם דרך ספריית datasets בפייתון בעזרת הסכמה המוגדרת בתיעוד.

איך טוענים

הקבצים שמורים בפורמט JSONL מכווץ ב־zstd, כך שתצטרכו להתקין את הכלי כדי לחלץ אותם מקומית לפני טעינה ידנית. אפשר לטעון את הדאטהסט ישירות דרך ספריית datasets באמצעות הגדרת הסכמה של מערך ההודעות. לניסוי ראשוני מומלץ להשתמש בקובץ הדגימה שמכיל אלף רשומות בלבד. הגישה למאגר פתוחה לחלוטין ואין צורך בבקשת אישור או בהגדרת טוקן.

from datasets import load_dataset

ds = load_dataset("a-m-team/AM-DeepSeek-R1-Distilled-1.4M")

הרישיון

המאגר מוגדר ברישיון CC-BY-NC-4.0 שמחייב מתן קרדיט ליוצרים ואוסר לחלוטין כל שימוש מסחרי. מעבר לכך, הכרטיס מדגיש שהשימוש בדאטהסט, בקוד ובכל תוצר שנוצר ממנו מותר למטרות מחקר בלבד. מודל שתאמנו על הנתונים הללו לא יוכל לשמש מוצר מסחרי או שירות בתשלום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗