GPT
Q

Qwen3.8-2.4T-A95B

קוד פתוח

Qwenother2026-08-08

  • transformers
  • safetensors
  • qwen3_5_moe_text
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

משקולות פתוחות של מודל ענק עם מעל שני טריליון פרמטרים וארכיטקטורת מומחים. מתאים למי שחייב ביצועים ברמת הדגמים הסגורים המובילים ובשליטה מקומית מלאה.

  • 2446Bפרמטרים
  • 262,144טוקנים בהקשר
  • 4.4 TBמשקל הקבצים
  • 52,672הורדות בחודש

מה זה

מדובר במודל שפה מבוסס תערובת מומחים עם 2,446,182,725,504 פרמטרים בסך הכל, שמתוכם 95 מיליארד מופעלים בכל מעבר קדימה. המבנה הפנימי משלב שכבות Gated DeltaNet עם Gated Attention על פני 92 שכבות, וכולל 512 מומחים כשבכל פעם נבחרים עשרה מומחים מנותבים ואחד משותף. חלון ההקשר עומד על 262,144 טוקנים ישירות מהקופסה, וניתן להרחבה עד 1,010,000 טוקנים.

בבנצ'מרקים של סוכני תכנות ועבודה אוטונומית, הוא עוקף את הדור הקודם בפער ניכר. ב־SWE-bench Pro הוא עומד על 67.7 לעומת 60.6 בגרסה הקודמת, וב־PaperBench הוא מטפס ל־93.0 לעומת 64.8, תוך עקיפת Opus 4.8 ו־Fable 5. עם זאת, במשימות תכנות מעמיקות כמו DeepSWE 1.1 הוא מקבל 56.6, מה שמשאיר אותו מאחורי Fable 5 שמגיע ל־70.0 ו־GPT 5.6 Sol שמגיע ל־73.0.

הוא כולל שליטה ידנית בעומק החשיבה בעזרת פרמטר reasoning_effort ויכולת לשמור הקשר של חשיבה היסטורית בין הודעות. המטרה כאן היא להריץ משימות מרובות שלבים עם קבלת משוב מהסביבה, בלי לאבד כיוון באמצע הדרך.

מתאים ל

  • סוכן תכנות לקוד פתוח

    התוצאה של 86.6 ב־Terminal Bench 2.1 מאפשרת להריץ פקודות מסוף ולפתור בעיות בסביבות פיתוח מורכבות.

  • ניתוח מסמכי ענק

    חלון הקשר של 262,144 טוקנים עם הרחבה מעבר למיליון מאפשר עיבוד תיקי מסמכים שלמים בלי חיתוך.

  • אוטומציה של מחקר מדעי

    ציון 93.0 ב־PaperBench מספק יכולת חזקה של קריאה, השוואה וניתוח מעמיק של מאמרים טכניים.

איפה זה נופל

המודל הזה מוגבל מאוד ביכולת העבודה עם מולטימודל מהקופסה. גרסת המשקולות כאן היא מודל טקסט בלבד, בעוד תמיכה בתמונות קיימת רק בגרסה המנוהלת בענן. אם המוצר שלכם צריך קלט תמונה, המשקולות האלה פשוט לא יעזרו.

במבחנים מורכבים במיוחד הוא עדיין מתקשה. במבחן Agents' Last Exam הוא עומד על ציון מעבר של 27.0 בלבד וציון כללי של 52.4. ב־Automation-Bench הוא משיג 27.3 במעבר ראשון. זה אומר שבמשימות אוטונומיות ארוכות מאוד הוא עדיין נכשל ברוב הניסיונות, ואסור לתת לו לרוץ בסביבת פרודקשן בלי בקרה אנושית הדוקה.

אותה משפחה

Qwen3.8-2.4T יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל שנטען כאן זהה לחלוטין למה שמקבלים ב־API של Qwen3.8-Max?

לא. המשקולות האלה הן בסיס הטקסט, בעוד Qwen3.8-Max בענן כולל קלט תמונה, ברירת מחדל של מיליון טוקנים הקשר, יכולת לכבות חשיבה וכלים מובנים של המערכת.

אפשר להריץ את המודל הזה על שרת יחיד עם שמונה כרטיסי GPU?

לא בפורמט המקורי. המשקולות שוקלות 4.4 טרה־בייט ב־224 קבצים, כך שרק כדי לאחסן ולטעון אותן לזיכרון נדרש אשכול של עשרות כרטיסי מסך חזקים במקביל.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־4.4 טרה־בייט ב־224 קבצים בפורמט Transformers. כדי לטעון אותו אפילו בזיכרון מלא בלי קוונטיזציה צריך אשכול שרתים ייעודי ומרובה כרטיסי מסך עם חיבורי רשת מהירים מאוד. הוא נתמך במנועים כמו vLLM, SGLang ו־TokenSpeed.

לרוב המוחלט של המפתחים אין שום היתכנות כלכלית או חומרתית להוריד 4.4 טרה־בייט ולהרים תשתית כזו במשרד או בענן פרטי. אלא אם החברה שלכם מחויבת בבידוד נתונים מוחלט על שרתים בבעלותכם, אין היגיון להריץ אותו לבד. Qwen Cloud מציעים את גרסת Qwen3.8-Max כשירות מנוהל שכולל גם קלט תמונה וכלים מובנים בלי כאב הראש של הברזלים.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3.8-2.4T-A95B")
print(pipe("שלום"))

הקבצים

224 קבצים במאגר, 4.4 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other בכרטיס המודל. אין כאן רישיון קוד פתוח סטנדרטי כמו Apache 2.0 או MIT, אלא תנאי שימוש ייעודיים של Qwen שלא מפורטים בעמוד. לפני שמטמיעים את המשקולות האלה במוצר מסחרי, חייבים לבדוק את קובץ הרישיון המדויק בחבילה כדי לוודא שאין הגבלות על שימוש מסחרי, הגבלות הכנסה או דרישות דיווח.

הרישיון המלא בעמוד המודל ↗