GPT
D

DeepSeek-V4-Distill-8000x

קוד פתוח

Jackrongmit2026-04-24

  • reasoning
  • distillation
  • supervised-fine-tuning
  • chain-of-thought
  • deepseek-v4-flash

מדובר באוסף של אלפי דוגמאות אימון שנוצרו על ידי מודל להסבר תהליכי חשיבה מורכבים. הוא מתאים למי שרוצה לזקק יכולות נימוק למודל קטן בלי לייצר תשובות סינתטיות מאפס.

  • 2,302הורדות בחודש
  • 92לייקים

מה זה

המאגר כולל 7,716 רשומות שמיועדות לכוונון עדין של מודלים. השאלות נלקחו ממאגר קודם בשם Jackrong/GLM-5.1-Reasoning-1M-Cleaned, והתשובות הופקו באמצעות מודל המורה DeepSeek-V4-Flash. הסינון הסיר שאלות שדורשות מידע בזמן אמת, שאלות על זהות המודל, טקסטים ארוכים מדי ופניות שלא התאימו למבנה יציב של זיקוק ידע.

המבנה של כל רשומה כולל גם פורמט שיחה וגם שדות ישירים של קלט ופלט. הפלט מכיל לרוב בלוק חשיבה מובנה לצד התשובה הסופית. בנוסף יש מטא דאטה שכולל את ספירת הטוקנים עבור השאלה והתשובה, מזהה ייחודי, ותיוג של הדומיין תחת הערך main בלבד.

מתאים ל

  • כוונון עדין ליכולות חשיבה

    אימון מודלים קטנים על תשובות שכוללות בלוק מחשבה מפורט לשיפור נימוקים מורכבים.

  • זיקוק מודל DeepSeek

    העברת ידע ודפוסי ניתוח מביצועי DeepSeek-V4-Flash למודל קצה ייעודי.

  • ניסויי התאמת פורמט אימון

    בדיקת צינורות SFT מבוססי שיחה לעומת מבנה של קלט ופלט ישירים.

איפה זה נופל

התשובות נוצרו במלואן על ידי מודל שפה, ולכן הן כוללות שגיאות עובדתיות, הטיות סגנון וארטיפקטים שנולדו בתהליך ההסקה שלו. המאגר כולו בנוי באנגלית בלבד, ואין בו נתונים בעברית. הכרטיס מבהיר במפורש שהתוכן אינו מתאים למערכות קריטיות מבחינת בטיחות ללא בדיקה ידנית, ושצריך לבחון את תנאי השימוש של מקורות המידע והתוכן הסינתטי לפני שילוב במוצר.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר מוגדר ומכיל טקסטים באנגלית בלבד. אם המטרה שלכם היא מודל שמבין או עונה בעברית, הנתונים האלה לא יספקו את המענה הנדרש ללא תרגום או הרחבה.

האם מותר להשתמש בו למוצר מסחרי?

הרישיון המוגדר הוא MIT, שמתיר שימוש מסחרי ללא מגבלת שיתוף זהה. יחד עם זאת, דף המאגר מציין במפורש שעליכם לבדוק את תנאי השימוש של מודל המקור שהפיק את התוכן לפני שאתם מפיצים מוצר.

מה הגודל של סט הנתונים?

הפיצול הזמין מכיל 7,716 רשומות אימון. המאגר עצמו מורכב מקובץ JSONL בודד לצד קובצי תמונות ודוחות קטנים, כך שהורדה וטעינה שלו דורשות שטח אחסון וזמן עיבוד מינימליים.

מאיפה הגיעו השאלות והתשובות?

השאלות נלקחו ממאגר קודם שסונן בשם Jackrong/GLM-5.1-Reasoning-1M-Cleaned. כל התשובות הופקו באופן מלא באמצעות המודל DeepSeek-V4-Flash ולא נכתבו ידנית על ידי בני אדם.

איך טוענים

טוענים את המאגר ישירות בפורמט JSONL מתוך קובץ האימון שנמצא בנתיב data/train.jsonl. אין צורך לבקש אישור גישה מראש כדי להתחיל לעבוד. מבחינת שדות, כדאי לשים לב להפרדה בין conversations לבין צמד השדות input ו־output, כדי לבחור את המבנה שמתאים לצינור האימון שלכם.

from datasets import load_dataset

ds = load_dataset("Jackrong/DeepSeek-V4-Distill-8000x")

הרישיון

המאגר מסומן תחת רישיון MIT. המשמעות היא היתר רחב מאוד לשימוש, כולל שימוש מסחרי ושינוי של הנתונים, כל עוד שומרים על הודעת זכויות היוצרים המקורית. עם זאת, הכרטיס מזכיר למשתמשים לוודא בעצמם את תנאי השימוש של המודל שיצר את הטקסטים ושל מאגרי המקור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗