GPT
K

kimi-k3-distillation

קוד פתוח

beyoruother2026-08-05

  • distillation
  • sft
  • reasoning
  • tool-use
  • multi-turn

מאגר זיקוק ממוקד של 4,347 דוגמאות שנלקחו ישירות מהמודל Kimi k3. הוא מיועד למי שרוצה לאמן מודל על עקבות החשיבה של מורה יחיד בלי הרעש של מודלים אחרים.

  • 5,920הורדות בחודש
  • 15לייקים

מה זה

המאגר הזה הוא חיתוך נקי מתוך מאגר גדול יותר של r0b0tlab שכלל במקור גם מודלים של Qwen ושל GLM. היוצר בודד רק את הרשומות שבהן המודל המורה הוגדר במפורש כ־kimi-code/k3, והסיר את כל השאר. התוצאה מכילה 4,347 רשומות שמחולקות ל־3,918 דוגמאות אימון, 212 לוולידציה ו־217 למבחן.

מבחינת תכנים, המאגר מתמקד במשימות מורכבות: הוראות קפדניות, הקשר ארוך, מדע ולוגיקה, מתמטיקה פורמלית, קוד להרצה ושימוש בכלים כסוכן. כל שורה שייכת לתחום מוגדר וכוללת מזהי מעקב שמוודאים שמדובר בנתוני התוסף הרשמיים של המורה הזה.

היוצר טיפל בבעיה מהמאגר המקורי, שבו שכבו קבצים ישנים וחדשים יחד באותה תיקייה. החיתוך כאן שולף אך ורק את הדור המעודכן ביותר ומציע מספר תצורות טעינה, החל מפורמט SFT רגיל עם הודעות וכלים, ועד תצורת canonical שמכילה 32 עמודות ביקורת מלאות.

מתאים ל

  • אימון SFT להוראות נוקשות

    חידוד מודל לעמידה מדויקת במגבלות והנחיות מורכבות בעזרת מעל אלף דוגמאות ייעודיות.

  • הטמעת יכולות הפעלת כלים

    אימון סוכנים אוטומטיים לפעולות עם כלים חיצוניים על בסיס 208 דוגמאות סוכן מתועדות.

  • חיזוק יכולת מתמטית וקוד

    שיפור ביצועים במשימות הגיון, קוד להרצה ופתרון בעיות מתמטיות מנומקות.

איפה זה נופל

המאגר תומך רק באנגלית ובסינית, כך שאין בו שום תוכן בעברית ולא תלמדו ממנו שפה מקומית. ארבע תצורות מהמאגר המקורי, כולל רב-לשוניות ושיחות רגילות, הושמטו לחלוטין כי לא הכילו נתונים של המודל הספציפי הזה. בנוסף, הנפח הכולל קטן מאוד ועומד על פחות מחמשת אלפים דוגמאות, כך שהוא מתאים לחידוד יכולות מאוד ספציפיות ולא לאימון בסיסי.

שאלות
נפוצות

האם יש במאגר תמיכה בעברית?

לא. המאגר מוגדר לשפות אנגלית וסינית בלבד. כל תצורות השיחה הרב-לשוניות שהיו במאגר המקורי סוננו החוצה כי לא הגיעו מהמודל הזה.

מותר להשתמש בזה לפיתוח מודל מסחרי?

הרישיון מסומן בתור other ואינו רישיון קוד פתוח סטנדרטי. צריך לבדוק את קובץ LICENSE במאגר ואת תנאי השימוש בפלט של Kimi לפני שמשלבים את זה במוצר מסחרי.

במה הוא שונה מהמאגר המקורי של r0b0tlab?

המאגר המקורי ערבב פלטים משלושה מודלים שונים וכלל קבצי אימון ישנים ומבולגנים. המאגר הזה בודד אך ורק את הפלטים של Kimi k3 וסינן גרסאות קבצים ישנות כדי למנוע דליפת נתונים לא מעודכנים.

איזה פורמט נתונים מקבלים כשמורידים אותו?

תלוי בתצורה שבוחרים. תצורת ברירת המחדל מביאה מבנה שיחה מוכן לאימון עם הודעות וכלים, בעוד שתצורת canonical מביאה 32 עמודות מטא-דאטה שכוללות אשכולות כפילות ובדיקות אימות.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face. אין צורך בבקשת גישה מיוחדת או באישור ידני. ברירת המחדל טוענת את תצורת sft עם שדות של הודעות, כלים ומשקלי דגימה. אם אתם צריכים לחקור את מקור הנתונים, תצורת canonical מחזירה את כל 32 עמודות הביקורת כולל בדיקות אימות ומזהי אשכולות לכפילויות.

from datasets import load_dataset

ds = load_dataset("beyoru/kimi-k3-distillation")

הרישיון

הרישיון מוגדר בתור other וממשיך את תנאי המקור של r0b0tlab בלי פירוט חופשי פתוח. חובה לפתוח את הקבצים LICENSE ו־PROVENANCE.md במאגר לפני שנוגעים בו. בלי בדיקה של התנאים האלה והגבלות השימוש של Kimi, אי אפשר להניח שמותר להשתמש בזה למודל מסחרי.

הרישיון המלא ב־Hugging Face ↗