GPT
Q

Qwen3.8-27B-Distillation-40K

קוד פתוח

faunixapache-2.02026-08-22

  • distillation
  • qwen3.8
  • qwen3.8-27b
  • sft
  • reasoning

המאגר מרכז 40,000 מסלולי חשיבה שנוצרו על ידי המודל Qwen3.8-27B. הוא מיועד למי שרוצה לאמן מודלים קטנים יותר להסביר שלב אחרי שלב בעיות בקוד, במתמטיקה, במדעים ובלוגיקה.

  • 3,338הורדות בחודש
  • 35לייקים

מה זה

כל רשומה במאגר מייצגת שיחה בין משתמש לעוזר, כשתשובת העוזר פותחת תמיד בתגיות חשיבה ואחריהן מופיע המענה הסופי. הנתונים מחולקים לארבעה תחומים מרכזיים: קוד מהווה קצת מעל 40% מהדוגמאות, מתמטיקה תופסת מעל 27%, מדעים מהווים 17.5%, והיתר מוקדש לחידות היגיון ולוגיקה. ממוצע הטוקנים לדוגמה עומד על כמעט 5,749, כאשר רוב הנפח מוקדש לתהליך המחשבה של המודל.

הפרומפטים נדגמו מתוך 12 מאגרי קוד פתוח מוכרים, ביניהם אוספי תכנות, חידות לוגיות, ומאגרי מתמטיקה כמו OpenMathReasoning ו־OpenR1-Math. התשובות נוצרו בהרצה מקומית של המודל בדיוק FP8 באמצעות מנוע vLLM. תהליך הסינון המתואר בכרטיס בסיסי ביותר, וכלל הסרה של כפילויות ומחיקת דוגמאות לא תקינות.

מתאים ל

  • אימון מודלים להסבר שלבים

    כוונון עדין של מודלים קטנים כדי שילמדו לייצר שרשראות חשיבה סדורות לפני שליפת התשובה.

  • שיפור ביצועים בכתיבת קוד

    אימון על כ־16,000 דוגמאות תכנות הכוללות ניתוח מקדים של הבעיה לפני כתיבת הפתרון.

  • פתרון בעיות במתמטיקה

    הטמעת דפוסי עבודה מסודרים לפתרון משוואות ובעיות הגיון מדעיות שמצריכות דיוק חישובי.

איפה זה נופל

הנתונים כולם באנגלית בלבד, ואין כאן נגיעה לשפות אחרות או התאמה למשימות בעברית. מעבר לכך, הסינון המוצהר הוא הסרת כפילויות בסיסית, בלי אימות אוטומטי של נכונות הפתרונות או הרצת הקוד שנפלט. מודל המקור עלול לייצר טעויות עובדתיות או הנחות שגויות שמוסוות בתוך שרשרת חשיבה משכנעת, ולכן חובה לסנן או לדגום את הפלטים לפני שמכניסים אותם לסביבת ייצור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון של המאגר הוא apache-2.0, ולכן אין מניעה חוקית להשתמש בו לצרכים מסחריים או לאמן עליו מודלים פנימיים. חובה רק לצרף את תנאי הרישיון המקוריים בהפצה.

האם המאגר כולל תוכן בעברית?

לא, המאגר מסומן באנגלית בלבד וכל הפרומפטים שנדגמו ממקורות הקוד הפתוח הם באנגלית. אם המטרה היא כוונון למשימות בעברית, הנתונים האלה לא יספקו מענה ישיר.

איך נוצרו התשובות וההסברים של הדאטהסט?

היוצרים אספו 40,000 פרומפטים מ־12 מקורות קוד פתוח והזינו אותם למודל Qwen3.8-27B. הריצה התבצעה על תשתית מקומית באמצעות vLLM בדיוק FP8, והתשובות חולצו יחד עם שלבי החשיבה המובנים.

האם יש אימות שהתשובות נכונות לחלוטין?

לא נערך אימות מתמטי או בדיקת הרצה של הקוד. הכרטיס מדווח על הסרת כפילויות ודוגמאות שבורות בלבד, כך שאימון עיוור עלול לחשוף את המודל שלכם להזיות שנוצרו במקור.

איך טוענים

המאגר שמור בשלושה קבצי Parquet תחת פיצול train יחיד, ונטען ישירות באמצעות ספריית datasets בלי צורך באישור גישה מראש. כל שורה מכילה את מערך ההודעות messages, את התחום, את הקטגוריה המפורטת, את מקור הפרומפט המקורי וספירת טוקנים מדויקת. חשוב לשים לב לאורך הקשר, שכן תשובות המודל כוללות תגיות חשיבה ארוכות שמביאות את הרצף הממוצע לאלפי טוקנים ומחייבות חלון הקשר נדיב באימון.

from datasets import load_dataset

ds = load_dataset("faunix/Qwen3.8-27B-Distillation-40K")

הרישיון

המאגר מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי למטרות מחקר וגם לפיתוח מסחרי. מותר לשנות את הנתונים, להפיץ אותם מחדש ולאמן עליהם מודלים משלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. הרישיון אינו כופה עליכם לשתף את המודל המאומן באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗