GPT
Q

Qwen3.8-2.4T-A95B-FP8

קוד פתוח

Qwenother2026-08-08

  • transformers
  • safetensors
  • qwen3_5_moe_text
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת קוד פתוח ראשונה ברמת Max מבית Qwen, עם ארכיטקטורת תערובת מומחים ענקית שמפעילה רק 95 מיליארד פרמטרים בכל שלב. מתאים למי שבונה סוכנים מורכבים ולא תלוי בספק ענן סגור.

  • 2446Bפרמטרים
  • 262,144טוקנים בהקשר
  • 2.3 TBמשקל הקבצים
  • 19,343הורדות בחודש

מה זה

מדובר במודל שפה ענק עם 2.4 טריליון פרמטרים בסך הכל, שבנוי כארכיטקטורת תערובת מומחים עם 512 מומחים, שמתוכם עובדים בפועל 11 מומחים בלבד בכל טוקן. המבנה משלב שכבות Gated DeltaNet יחד עם Gated Attention ואימון לחיזוי מרובה טוקנים. המשקלים מגיעים בכיול FP8 עם בלוקים בגודל 128 כדי לצמצם את אובדן הדיוק לעומת המקור.

המטרה המרכזית שלו היא משימות סוכנים, כתיבת קוד ופתרון בעיות מתמשכות בסביבות מורכבות. במבחני סוכני פיתוח כמו SWE-bench Pro הוא משיג 67.7 נקודות לעומת 60.6 של הדור הקודם, ובמבחן PaperBench מגיע ל־93 נקודות, שזה שיפור ניכר על פני גרסאות קודמות. ברוב המבחנים הכלליים הוא עדיין לא עוקף מודלים סגורים מובילים כמו Fable 5, אבל הוא עקבי בהרבה מהדור הקודם של אותה סדרה.

מתאים ל

  • סוכני פיתוח אוטונומיים

    משיג 86.6 ב־Terminal Bench ומתמודד טוב עם משוב שגיאות מתמשך בטרמינל.

  • מחקר ועיבוד טקסט ארוך

    חלון הקשר מקורי של 262 אלף טוקנים עם תוצאה של 93 ב־PaperBench.

  • אוטומציה של כלי עבודה

    מציג 72.5 ב־Toolathlon ומאפשר שליטה בעומק החשיבה בזמן ריצה.

איפה זה נופל

המודל הזה כבד בצורה קיצונית להרצה עצמית, והגרסה הזו מגיעה ללא קלט תמונה וללא תמיכה במצב עבודה ללא חשיבה, תכונות ששמורות לשירות ה־API בשם Qwen3.8-Max. בנוסף, במבחני תכנות עמוקים כמו DeepSWE 1.1 הוא מקבל 56.6 לעומת מעל 70 במודלים מסחריים מתחרים, ובמבחני סוכנים קשים במיוחד כמו Agents Last Exam הוא עומד על 27 בלבד.

אותה משפחה

Qwen3.8-2.4T יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מזהה תמונות?

לא. המשקלים בגרסה הזו תומכים בטקסט בלבד. תמיכה בקלט ויזואלי קיימת רק דרך שירות ה־API של Qwen3.8-Max בענן שלהם.

האם אפשר להריץ אותו על שרת יחיד של שמונה כרטיסי H100?

לא. המשקל עומד על 2.3 טרה בייט ב־FP8, כך ששמונה כרטיסים של 80 גיגה מספקים רק 640 גיגה בייט זיכרון. נדרש אשכול של עשרות כרטיסים במקביל רק כדי לטעון אותו.

איך מריצים

המשקלים שוקלים 2.3 טרה בייט בפורמט FP8 שמחולק ל־224 קבצים. אי אפשר להריץ דבר כזה על שרת בודד או מחשב מקומי רגיל. אתם חייבים אשכול מרובה כרטיסים בעלי זיכרון VRAM מצטבר של מעל 2.5 טרה בייט, ותמיכה בספריות כמו vLLM, SGLang או TokenSpeed שמבינות את המבנה הייחודי שלו.

אם אין לכם חוות שרתים ייעודית עם תמיכה ישירה בחישובי FP8 ורוחב פס מהיר מאוד בין השרתים, אין טעם להוריד את המשקלים. במצב כזה עדיף לפנות ישירות לשירות ה־API בענן של Qwen.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3.8-2.4T-A95B-FP8")
print(pipe("שלום"))

הקבצים

224 קבצים במאגר, 2.3 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ולכן הוא אינו רישיון פתוח סטנדרטי מוכר כמו MIT או Apache. אסור להניח שמותר להשתמש בו במוצר מסחרי בלי לקרוא את קובץ הרישיון המצורף לחבילה.

הרישיון המלא בעמוד המודל ↗