GPT
Q

qwen3.8-max-distillation-50k

קוד פתוח

r0b0tlabother2026-07-22

  • distillation
  • knowledge-distillation
  • reasoning
  • chain-of-thought
  • supervised-fine-tuning

מאגר זיקוק של כמעט חמישים אלף פלטים ממודל qwen3.8-max-preview, שמתמקד במתמטיקה, קוד והסקה. החומר שומר על תהליכי החשיבה הגלויים של המודל כדי ללמד מודלים קטנים יותר לחשוב בשלבים.

  • 2,180הורדות בחודש
  • 117לייקים

מה זה

המאגר כולל 49,772 רשומות שמחולקות לאימון עם 44,796 שורות, וסטים של אימות ומבחן עם 2,488 שורות בכל אחד. השלדה מורכבת בעיקר ממתמטיקה עם 33.3%, קוד עם 28.2%, והסקה עם 23.5%. יש גם מעקב אחר הוראות שתופס 14.7%, ושימוש בכלים שמהווה 0.3% בלבד. הפרומפטים נלקחו ממאגרים מוכרים כמו Evol-Instruct-Code, MetaMathQA, CodeAlpaca, Tulu 3 ו־NuminaMath-CoT.

הטקסטים נוצרו דרך ה־API של עליבאבא קלאוד עם טמפרטורה של 0.7 וחלון השלמה של עד 8,192 תוקנים, כאשר רוב הפלטים קיבלו תקציב חשיבה של 2,048 תוקנים. מתוך 53,693 דגימות גולמיות, הסינון הסיר תשובות קטועות, פלטים קצרים מדי וסירובים להפעלת כלים. כל רשומה במאגר מחזיקה מזהה, תחום, מקור, רמת קושי, מערך הודעות בפורמט צ'אט, ציון איכות היוריסטי, אורך בתוקנים, ולעתים תשובת ייחוס.

מתאים ל

  • אימון מודלי חשיבה קטנים

    לימוד מודלים קטנים לייצר בלוקי מחשבה מפורטים לפני שליפת תשובה סופית במתמטיקה וקוד.

  • מחקר על זיקוק ידע

    בדיקת השפעת שילוב בין תשובות ישירות לתשובות שכוללות תהליך חשיבה ארוך על ביצועי המודל הלומד.

  • כיוונון למעקב אחר הוראות

    תרגול מודלים על פתרון בעיות קוד מורכבות והחזרת תשובות בפורמט מובנה ומוגדר מראש.

איפה זה נופל

התשובות לא עברו אימות עובדתי ידני אלא סינון היוריסטי, כך שטעויות חישוב והסקה של מודל המקור עדיין קיימות בפנים. המאגר מכיל פרומפטים ישירים מתוך מבחני ביצועים מקובלים כמו GSM8K, HumanEval, MBPP ו־ARC, מה שאומר שאימון עליו יזהם לחלוטין הערכות ביצועים סטנדרטיות. השפה היא אנגלית, ואין פה מענה בעברית. בנוסף, תחום השימוש בכלים כולל 126 דוגמאות בלבד ולא מתאים לאימון יכולות כאלה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא באופן חופשי. תנאי השימוש של ספק התשתית עליבאבא אוסרים על אימון מודלים שמתחרים בשירותים שלו. מעבר לזה, כרבע מהנתונים נלקחו ממקורות ברישיון לא-מסחרי מפורש, כך שהמאגר מיועד למחקר בלבד.

האם המאגר כולל נתונים בעברית?

לא, הנתונים הם באנגלית בלבד. המקורות שממנו נאספו הפרומפטים והתשובות שנוצרו על ידי המודל מבוססים כולם על מאגרי קוד והסקה לועזיים. לפיתוח מודל שדובר עברית תצטרכו לחפש או לייצר נתונים אחרים.

איך נאספו וסוננו הנתונים?

החוקרים הריצו כ־53 אלף פרומפטים מול מודל qwen3.8-max-preview עם תקציב חשיבה מוגדר. בשלב הסינון נזרקו פלטים חלקיים, תשובות ריקות או קצרות וסירובים, ונשארו רק תשובות שקיבלו ציון איכות היוריסטי מספק ומבנה תקין.

האם המאגר מתאים לאימון מודלים על הפעלת פונקציות וכלים?

ממש לא. מתוך קרוב לחמישים אלף דוגמאות, רק 126 שורות עוסקות בשימוש בכלים לאחר הסינון. הכמות הזו זניחה לחלוטין ולא תספיק כדי ללמד מודל להתממשק עם סביבות חיצוניות או להפעיל כלים בצורה יציבה.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה datasets של Hugging Face בלי צורך באישור גישה מיוחד. הנתונים מחולקים לשלושה קבצי Parquet שמכילים את כל החלוקות, יחד עם קובצי תיעוד נלווים. במבנה הנתונים כדאי לשים לב לשדה messages שכולל את התפקידים system, user ו־assistant, כאשר ב־82.6% מתשובות העוזר מופיע בלוק חשיבה מפורש. השדה ground_truth חסר בכמעט 20% מהמקרים, כך שאם בונים תהליך שדורש השוואה ישירה לפתרון ידוע, צריך לקחת את זה בחשבון.

from datasets import load_dataset

ds = load_dataset("r0b0tlab/qwen3.8-max-distillation-50k")

הרישיון

הרישיון מוגדר כ־other ומציב מגבלות קשות. תנאי השימוש של עליבאבא קלאוד אוסרים על שימוש בפלטים כדי לפתח מוצרים שמתחרים בהם, ובנוסף לפחות 24.3% מהשורות מגיעות ממאגרים עם רישיונות לא-מסחריים כמו CC BY-NC-SA 4.0 ו־CC BY-NC 3.0. המשמעות ברורה, המאגר לא מאושר לשימוש מסחרי חופשי או לאימון מודלים מסחריים.

הרישיון המלא ב־Hugging Face ↗