GPT
Q

Qwen3.8-9B-Distill

קוד פתוח

empero-aiapache-2.02026-08-15

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • empero-ai

זיקוק מלא של מודל ענק לתוך 9.7 מיליארד פרמטרים שמתאימים לכרטיס מסך בודד. המטרה כאן היא להביא יכולות חשיבה עמוקות במתמטיקה וקוד בלי לשלם על תשתית שרתים כבדה.

  • 9.7Bפרמטרים
  • 262,144טוקנים בהקשר
  • 18.0 GBמשקל הקבצים
  • 26,678הורדות בחודש

מה זה

המודל הזה לוקח את הבסיס של Qwen3.5-9B ומעדכן את כל המשקלים שלו בעזרת זיקוק של שבעים אלף דוגמאות חשיבה ממודל ענק של 2.4 טריליון פרמטרים. כל תשובה שלו נפתחת בבלוק חשיבה מובנה, עם דגש חזק על פתרון בעיות מתמטיות, תכנות, והפעלת כלים ישירות מהקופסה בלי מעטפת חיצונית.

במבחני ביצועים, ההשפעה של הזיקוק הזה ברורה מאוד. במבחן MMLU התוצאה שלו קפצה ביותר מעשרים אחוזים לעומת מודל הבסיס, עד לדיוק של מעל שבעים וחמישה אחוזים. לעומת זאת, במבחן GSM8K של בעיות מילוליות בחשבון הדיוק דווקא ירד מעט מ־88.5% ל־87%, כך שהשיפור הוא בעיקר בידע כללי רחב וניתוח ולא בחישובים פשוטים.

מתאים ל

  • פתרון בעיות קוד

    המודל אומן על פתרון בעיות תכנות תחרותי ופותח בבלוק מחשבה לפני כתיבת הקוד.

  • הפעלת כלים אוטונומית

    תמיכה מובנית בזימון פונקציות לפי הפרוטוקול של Qwen בלי צורך בהתאמות נוספות.

  • ניתוח מסמכים טכניים

    חלון קשר ענק של 262,144 טוקנים מאפשר להכניס ספריות קוד שלמות לתוך ההקשר.

איפה זה נופל

המודל נוטה לחפור. מכיוון שהוא אומן לחקות מודל ענק, הוא פותח כל תשובה בבלוק חשיבה ארוך ולפעמים מתלבט דקות ארוכות גם על שאלות טריוויאליות, מה שמחייב אתכם לתת לו תקציב טוקנים נדיב של עד 16,384 טוקנים ולחתוך את בלוק החשיבה לפני שהמשתמש רואה אותו. בנוסף, חל איסור מוחלט על שימוש בדגימה חמדנית שגורמת לו להיכנס ללולאות של חזרתיות, והוא מוגדר לשפה האנגלית בלבד, בלי שום בדיקה או התחייבות ליכולות עיבוד תמונה למרות ארכיטקטורת הבסיס.

אותה משפחה

Qwen3.8 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה התוצאה במתמטיקה ירדה לעומת מודל הבסיס?

במבחן GSM8K המודל המזוקק ירד באחוז וחצי לעומת הבסיס. זה קורה לפעמים בזיקוק כשהמודל לומד דפוסי חשיבה מורכבים שמסבכים שאלות חיבור וחיסור פשוטות, בזמן שבמבחני הבנה רחבים כמו MMLU הוא זינק בעשרים אחוזים.

האם אפשר להריץ אותו ישירות בלי קרנלים מיוחדים?

אפשר טכנית, אבל זה רעיון רע מאוד. בלי flash-linear-attention ו־causal-conv1d המודל יעבוד לאט להחריד ויצרוך כמות מוגזמת של זיכרון בגלל נפילה למימושים בסיסיים של פייט׳ורץ.

איך מונעים ממנו לחזור על עצמו בפלט?

המפתחים מגדירים במפורש לעבוד עם טמפרטורה של 0.6, ערך top_p של 0.95 ו־top_k של 20. פענוח חמדני רגיל מכניס מודלים מהסוג הזה ללולאות אינסופיות של טקסט חוזר.

איך מריצים

המשקלים שוקלים 18 גיגה בייט ומחייבים כרטיס מסך בודד עם 24 גיגה זיכרון כדי לרוץ בנוחות בפורמט bfloat16. כדי לקבל ביצועים סבירים בספריות כמו transformers או vLLM, חובה להתקין קרנלים ייעודיים של flash-linear-attention ושל causal-conv1d, אחרת שכבות הקשב הלינארי יפלו למימוש פייט׳ורץ איטי שזולל זיכרון.

אם אתם צריכים רק שאילתות בודדות פה ושם, עדיף להשתמש ב־API חיצוני של מודל ענן ולא להסתבך עם התקנת ספריות CUDA מקומיות. הריצה המקומית משתלמת רק כשרוצים שליטה מלאה בנתונים וחלון קשר ארוך בלי לשלם פר טוקן.

from transformers import pipeline

pipe = pipeline("text-generation", model="empero-ai/Qwen3.8-9B-Distill")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר ברישיון apache-2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗