GPT
A

AM-DeepSeek-R1-0528-Distilled

קוד פתוח

a-m-teamרישיון לא דווח2025-06-04

  • reasoning

מאגר זיקוק שמכיל 2.6 מיליון שיחות שלמות עם שרשראות חשיבה ארוכות שנלקחו מגרסת DeepSeek-R1-0528. הוא מיועד למי שרוצה לאמן מודל על הסקת מסקנות מתמטית ולוגית בלי לייצר את המענה בעצמו.

  • 1,366הורדות בחודש
  • 102לייקים

מה זה

המאגר בנוי משאילתות שנאספו ממקורות קיימים כמו OpenHermes-2.5, עבורן הופקו תשובות מלאות מגרסת DeepSeek-R1-0528. המענה כולל את תגיות החשיבה והתשובה הסופית. התשובות במתמטיקה ארוכות פי 1.5 עד 2 מגרסאות מוקדמות של המודל כדי לפרט את שלבי הפתרון. לפי הדיווח, אימון של Qwen2.5-32B עליו הביא לציון 87.1 בבנצ'מרק AIME2024.

התוכן מחולק לקובצי jsonl לפי נושאים: שיחות כלליות ושיחות מרובות שלבים תופסות 1.223 מיליון רשומות, מתמטיקה כוללת 674 אלף, קוד מחזיק 412 אלף, מדע מכיל 220 אלף, ומעקב אחר הוראות מקיף 54 אלף. כל רשומה כוללת מטא-דאטה מפורט עם ציון אימות, ערך פרפלקסיטי, מקור השאילתה והפרדה בין שרשרת החשיבה לטקסט הסופי.

הסינון בוצע באופן אוטומטי. במתמטיקה בדקו מעבר של Math-Verify, בקוד הריצו מבחנים בסביבת ארגז חול, במדע נעשה שימוש במודל שפה להערכת דיוק, ובשיחה כללית השתמשו במודל תגמול. בנוסף, כל החלקים עברו ניקוי חזרות n-gram, בדיקת פרפלקסיטי דרך מודל 32B, ובדיקת קיום התגיות המבניות.

מתאים ל

  • אימון שרשראות חשיבה

    לימוד מודלים קטנים להפיק תהליכי הסקת מסקנות ארוכים ומובנים במתמטיקה ובקוד.

  • מחקר על זיקוק ידע

    השוואת ביצועים ויעילות של מודלים שאומנו על פלטים מגרסאות שונות של DeepSeek-R1.

  • הערכת תהליכי פתרון בעיות

    ניתוח איכות שלבי החשיבה של המודל לפי מדדי האימות שצורפו לכל דגימה.

איפה זה נופל

המאגר מוגבל לאנגלית ולסינית בלבד, ללא שום תמיכה בעברית. כל הנתונים מבוססים על פלט סינתטי של מודל יחיד, כך שהטיות, הזיות וטעויות לוגיות עקביות של DeepSeek עוברות ישירות לדאטה. בנוסף, שרשראות החשיבה הארוכות במתמטיקה מנפחות את כמות הטוקנים ומייקרות את האימון. היוצרים אוסרים במפורש שימוש מסחרי מכל סוג, ומגבילים את כל החומרים למחקר בלבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. למרות שבשדה הרישיון לא מופיע שם של רישיון מוכר, תנאי השימוש שהמפתחים כתבו אוסרים במפורש על שימוש מסחרי. החומר מוגדר למטרות מחקר בלבד.

האם יש בדאטהסט תמיכה בעברית?

לא. המאגר כולל תוכן באנגלית ובסינית בלבד לפי הגדרות המערכת. אין בו שאילתות או שרשראות חשיבה בעברית.

איך אימתו את התשובות של המודל?

אימות התוצאות נעשה לפי תחומים. במתמטיקה נעזרה הבדיקה בכלי Math-Verify, בקוד הריצו בדיקות תוכנה בארגז חול, ובשיחות כלליות השתמשו במודל תגמול ובמדדי פרפלקסיטי.

מה מייחד את הגרסה הזו לעומת פלטים רגילים של DeepSeek-R1?

הנתונים חולצו מגרסת R1-0528, שמייצרת פתרונות ארוכים ומפורטים יותר, בעיקר במתמטיקה שבה הפלטים ארוכים עד פי שניים. בנוסף, כל רשומה כוללת מטא-דאטה עם ציוני אימות והפרדה בין שלבי המחשבה לתשובה.

איך טוענים

טוענים את הקבצים ישירות מספריות פייתון שתומכות בקובצי jsonl או דרך Hugging Face. המאגר פתוח להורדה ללא דרישת אישור גישה מוקדם. הרשומות מגיעות במבנה שיחה שבו שדה השיחות מחזיק את ההודעות, כאשר מזהה הדובר מוגדר כמשתמש או כעוזר. בכל תגובה של העוזר יש שדה מידע פנימי עם שרשרת החשיבה בנפרד, התשובה עצמה, ומדד האימות. שדה הפרומפט המערכתי מופיע כריק בחלק מהמקרים, והיוצרים מציינים שלא השתמשו בו בתהליך האימון שלהם.

from datasets import load_dataset

ds = load_dataset("a-m-team/AM-DeepSeek-R1-0528-Distilled")

הרישיון

הרישיון הרשמי לא דווח בשדות המטא-דאטה, אך הטקסט של היוצרים אוסר במפורש על כל שימוש מסחרי ומגדיר את הדאטה למחקר בלבד. אסור לבנות על בסיס זה מודלים למוצרים מסחריים או לשלב אותו במערכות ייצור. הפרה של התנאי הזה מפרה ישירות את הנחיות השימוש של המפרסמים.

הרישיון המלא ב־Hugging Face ↗