GPT
Q

qwen3.8-max-glm5.2-kimi-k3-distillation

קוד פתוח

r0b0tlabother2026-07-26

  • distillation
  • sft
  • reasoning
  • tool-use
  • multi-turn

מאגר זיקוק שמרכז פלטים משלושה מודלי קצה, בעיקר למשימות מתמטיקה, קוד והנמקה. הוא מספק מסלולי שיחה מובנים, שלבי חשיבה ומשקולות דגימה מוכנות שחוסכות עבודת סינון ידנית.

  • 9,599הורדות בחודש
  • 251לייקים

מה זה

המאגר מכיל 57,937 שורות שמורכבות משיחות, שלבי מחשבה של מודלים והפעלות כלים. הוא מתבסס על פלטים שנאספו מ־Qwen3.8-Max שמחזיק ברוב הנפח, GLM-5.2 ו־Kimi Code K3. הפלטים האלה הוצמדו למאגרי בסיס מוכרים כמו Evol-Code, MetaMathQA, SciQ ו־tulu-3.

תהליך הניקוי כלל בדיקות תקינות של מבנה השיחה, וידוא זיהוי המודל המייצר, ואימות שהפעלות הכלים אמיתיות ולא רק טקסט JSON בתוכן התשובה. המפתחים הפעילו סינון כפילויות תלת-שכבתי שהסיר חפיפות ודגימות קרובות סמנטית. החלוקה הפנימית מציעה 24 תצורות שונות, כולל חיתוכים ייעודיים לקוד, מתמטיקה, סוכנים ומסלולי אימון ישירים.

מתאים ל

  • אימון מודל הנמקה ומתמטיקה

    אימון SFT ממוקד בעזרת עשרות אלפי דוגמאות שכוללות שלבי חשיבה מפורטים מנותחי מודלי שפה חזקים.

  • פיתוח סוכני שימוש בכלים

    לימוד קריאות לפונקציות על בסיס כמעט ששת אלפים מסלולי כלים אמיתיים עם נתוני הרצה מאומתים.

  • בדיקת זיקוק ממספר מודלים

    השוואת ביצועי מודל קטן שלומד משילוב פלטים של שלושה מודלים שונים באותו נושא.

איפה זה נופל

המאגר סובל מהטיה כבדה, כשמעל 84% מהנתונים מוקדשים להנמקה ומעל 86% בנויים כפנייה יחידה של משתמש ועוזר. שיחות ארוכות תופסות פחות משלושה אחוזים, וכיסוי רב-לשוני עומד על פחות מאחוז בודד, ללא עברית כלל. מודל שיאומן על הנתונים הגולמיים בלי לאזן אותם עלול לפספס בשיחות מתמשכות או בניסוח תשובות פשוטות וישירות.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא מומלץ. הרישיון מוגדר למחקר ומבוסס על פלטים סינתטיים של מודלים מסחריים כמו Qwen ו־Kimi, לצד מקורות ברישיונות משתנים כמו CC-BY-SA. שילוב כזה חושף מודלים מסחריים לסיכונים משפטיים.

האם הדאטהסט מתאים למודל שצריך לתמוך בעברית?

לא. התוכן הרב-לשוני מהווה פחות מאחוז מהמאגר וכולל בעיקר שפות כמו אנגלית, סינית, ספרדית וצרפתית. אין בו ייצוג לעברית, ולכן תצטרכו להביא מקורות נפרדים לחלוטין לשפה.

מה היתרון של התצורה המאוזנת על פני הנתונים הרגילים?

התצורה המאוזנת מתקנת בעזרת משקולות את הנטייה החזקה לשיחות קצרות ולעודף הנמקה. היא מעלה את החשיפה היחסית להפעלות כלים ושיחות ארוכות בזמן האימון, כדי שהמודל לא יתקבע על תבנית אחת.

מה מקור הנתונים במאגר?

הבסיס מגיע ממאגרי קוד ומתמטיקה קיימים כמו Evol-Code ו־MetaMathQA. עליהם הריצו המפתחים מודלים מתקדמים כדי להפיק שלבי מחשבה ותשובות, תוך סינון כפילויות ובדיקת תקינות התוצרים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה שמופיע בתיעוד, ללא צורך באישור גישה מוקדם. ברירת המחדל המומלצת היא התצורה המאוזנת, שכוללת את השדות messages, tools ומשקולת דגימה לכל שורה. מי שמאמן על GLM-4.7-Flash יכול להשתמש בקובצי Parquet מוכנים מראש שכוללים כבר את הטוקנים ומסכות החישוב על תשובות העוזר.

from datasets import load_dataset

ds = load_dataset("r0b0tlab/qwen3.8-max-glm5.2-kimi-k3-distillation")

הרישיון

הרישיון מוגדר כ־other ומיועד למחקר, כיוון שמדובר בקורפוס סינתטי שנגזר ממודלים מסחריים שונים. בנוסף, נתוני הבסיס מערבבים רישיונות מגוונים כמו MIT, Apache-2.0 ו־CC-BY-SA, שמחייבים ייחוס ושיתוף זהה בחלק מהרשומות. מודל שתאמנו עליו אינו נקי לשימוש מסחרי, ומומלץ להתייחס אליו כבסיס לניסויי מחקר בלבד.

הרישיון המלא ב־Hugging Face ↗