GPT
Q

Qwen3.8-4B-Distill

קוד פתוח

empero-aiapache-2.02026-08-15

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • empero-ai

המודל מציע יכולות חשיבה וניתוח של מודל ענק בתוך משקל קל של 4.7 מיליארד פרמטרים. הוא פונה למי שרוצה להריץ שרשראות חשיבה עצמאיות מקומית בלי תלות ברשת.

  • 4.7Bפרמטרים
  • 262,144טוקנים בהקשר
  • 8.7 GBמשקל הקבצים
  • 15,545הורדות בחודש

מה זה

הצוות של Empero לקח את בסיס Qwen3.5-4B וביצע עליו זיקוק פרמטרים מלא, לא מתאם חיצוני, באמצעות כ־45,000 דוגמאות חשיבה צפופות שנלקחו ממודל ענק של 2.4 טריליון פרמטרים. כל תשובה שלו נפתחת בבלוק חשיבה מובנה לפני המענה הסופי. הוא שומר על חלון הקשר ענק של 262,144 טוקנים ותומך בקריאות לפונקציות באופן טבעי לפי הפרוטוקול של Qwen.

במבחני ביצועים התמונה מעורבת. במבחן הידע הכללי MMLU המודל מציג קפיצה חדה מול מודל הבסיס, עם דיוק שעלה מ־0.354 ל־0.553. לעומת זאת, במתמטיקה של בית ספר יסודי ב־GSM8K נרשמה ירידה מ־0.850 ל־0.785. המשמעות היא שהזיקוק הרחיב את היכולת להתמודד עם שאלות הבנה וידע מורכבות, אך פגע מעט בדיוק החישובי היבש של מודל המקור.

מתאים ל

  • הסבר וניתוח טקסט עמוק

    מתאים לשאלות הדורשות שלבי הנמקה מפורטים באנגלית בלי להוציא נתונים לשירותי ענן חיצוניים.

  • הפעלת כלים מקומית

    מנצל תמיכה מובנית בקריאת פונקציות יחד עם חשיבה מקדימה כדי להחליט מתי להפעיל כלי.

  • עיבוד מסמכים ארוכים

    חלון של 262 אלף טוקנים מאפשר לקרוא קבצים כבדים ולנתח אותם ישירות על חומרה מקומית.

איפה זה נופל

המודל פולט בלוק מחשבה ארוך לפני כל תשובה ומחייב הקצאה של אלפי טוקנים לפלט, מה שיוצר השהיה מורגשת ומחייב אתכם לסנן את התגיות לפני הצגת המידע למשתמש. אסור להשתמש בחיפוש חמדן בדגימה כדי לא להיכנס ללולאות חזרתיות. בנוסף, הוא מתמקד באנגלית, אינו מיועד לקוד מורכב ומציג נסיגה בפתרון בעיות מתמטיות פשוטות ביחס לבסיס.

אותה משפחה

Qwen3.8 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לעבודה בעברית?

כרטיס המודל מציין אנגלית בלבד והאימון התבסס על שרשראות חשיבה באנגלית. אף שהבסיס עשוי לזהות עברית שבורה, הוא לא אומן לנמק בה ואין לצפות לפלטים איכותיים.

מדוע התוצאה במתמטיקה נמוכה יותר ממודל הבסיס?

במבחן GSM8K נרשמה ירידה מ־0.850 ל־0.785 בגלל תהליך הזיקוק, שהתמקד בהרחבת יכולות הנמקה כלליות על פני שינון תבניות חישוב קצרות, מה שפגע בדיוק בחישובים יבשים.

האם אפשר להריץ אותו ישירות בלי קרנלים מיוחדים?

אפשר להריץ אותו ב־PyTorch רגיל, אך ללא flash-linear-attention ו־causal_conv1d שכבות הקשב הלינארי יפעלו באיטיות רבה ויצרכו זיכרון רב מדי.

איך מריצים

במשקל של כ־8.7 ג'יגה־בייט בפורמט bf16, המודל נכנס בקלות לכרטיס מסך צרכני בודד עם 12 או 16 ג'יגה זיכרון, וגרסאות מכווצות יעבדו גם על מחשבים ניידים. ההרצה דורשת ספריות transformers עדכניות יחד עם קרנלים ייעודיים של flash-linear-attention ו־causal_conv1d כדי למנוע זחילה בביצועים וצריכת זיכרון עודפת.

אם אתם לא צריכים שרשרת חשיבה גלויה וארוכה, או שאין לכם כרטיס תומך בקרנלים הללו, קריאה ל־API של מודל ענן תחסוך את כאב הראש של הקינפוג וההמתנה לטוקנים שנוצרים בתהליך החשיבה המקדים.

from transformers import pipeline

pipe = pipeline("text-generation", model="empero-ai/Qwen3.8-4B-Distill")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אתם רשאים להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו במוצרים סגורים ולהפיץ אותו חופשי, בתנאי שתשמרו על הודעת זכויות היוצרים המקורית והצהרת הרישיון ללא אחריות של היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗