GPT
Q

Qwen3-Next-80B-A3B-Instruct

קוד פתוח

Qwenapache-2.02025-09-09

  • transformers
  • safetensors
  • qwen3_next
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

המודל הזה משלב גודל של 80 מיליארד פרמטרים עם הפעלה בפועל של 3 מיליארד בלבד בכל טוקן. הוא מיועד למי שצריך חלון הקשר ענק וביצועים של מודל ענק בלי לשלם בזמני תגובה איטיים.

  • 81Bפרמטרים
  • 262,144טוקנים בהקשר
  • 152 GBמשקל הקבצים
  • 285,574הורדות בחודש

מה זה

מדובר במודל שפה פתוח שמבוסס על שילוב שכבות MoE דלילות במיוחד עם מנגנון קשב היברידי שכולל Gated DeltaNet ו־Gated Attention. המבנה הזה מחזיק סך הכל 80 מיליארד פרמטרים, אבל מנתב כל טוקן רק ל־10 מומחים מתוך 512, מה שמשאיר רק 3 מיליארד פרמטרים פעילים ומקצר משמעותית את זמן החישוב.

במבחני ביצועים הוא עוקף מודלים צפופים בגודל 32B ומציג תוצאות שקרובות למודל 235B של אותה סדרה. במבחני קוד כמו LiveCodeBench הוא קיבל 56.6 לעומת 51.8 של דגם ה־235B, ובמדד Arena-Hard v2 הגיע ל־82.7 לעומת 79.2. היתרון הגדול שלו מופיע בטקסטים ארוכים במיוחד, שם הארכיטקטורה מצליחה לשמור על מהירות הפקה גבוהה בלי לקרוס תחת עלויות החישוב של קשב סטנדרטי.

מתאים ל

  • ניתוח מסמכים ארוכים

    חלון בסיסי של 256 אלף טוקנים מאפשר לקרוא ספרים שלמים ומסמכים טכניים בלי לקטוע את המידע.

  • פיתוח כלי קוד

    ציון של 56.6 במדד LiveCodeBench הופך אותו לפתרון מוביל לכתיבה ותיקון של קוד מורכב.

  • הפעלת כלים וסוכנים

    תמיכה בחיבור לכלים חיצוניים בפורמט MCP וביצועים של 70.3 במבחן BFCL-v3 לבחירת פונקציות.

איפה זה נופל

המודל תומך רק במצב שיחה רגיל ולא כולל מנגנון חשיבה פנימית או בלוקים של תהליך הסקת מסקנות. במשימות סוכנים מסוימות הוא מציג חולשה ברורה, כמו במבחן TAU2-Telecom שבו קיבל ציון של 13.2 בלבד לעומת 32.5 של המודל הגדול בסדרה. בנוסף, הרחבת חלון ההקשר למיליון טוקנים דורשת שימוש ב־YaRN סטטי, שעלול לפגוע באיכות התשובות בטקסטים קצרים. אם מגדילים את ערך presence_penalty כדי למנוע חזרתיות, הוא נוטה לעיתים לערבב שפות.

אותה משפחה

Qwen3-Next יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מסוגל לחשוב ולהציג שלבי מחשבה?

לא, המודל אומן כמודל הנחיות רגיל בלבד. הוא לא מייצר תגיות חשיבה ולא מפרט את הדיאלוג הפנימי לפני שהוא עונה.

מה צריך לשנות בהגדרות כדי לקרוא טקסט של חצי מיליון טוקנים?

חייבים להפעיל הרחבת YaRN בקובץ הקונפיגורציה או בפקודת ההרצה של המנוע. כדאי להגדיר פקטור מותאם לאורך הצפוי ולא סתם את המקסימום, כי הגדרה גלובלית כזו עלולה להוריד את רמת הדיוק כשתשלחו אליו פרומפטים קצרים.

איך מפיקים ממנו את מהירות התגובה המרבית?

עבודה עם vLLM או SGLang מאפשרת להפעיל Multi-Token Prediction שמאיץ את יצירת הטקסט. הרצה רגילה דרך Transformers תעבוד לאט בהרבה ותפספס את אופטימיזציות המהירות של הארכיטקטורה.

איך מריצים

כדי להריץ אותו צריך שרת רציני. המשקלים שוקלים 152 ג'יגה בייט בפורמט bfloat16, כך שצריך לפחות ארבעה כרטיסי מסך חזקים עם חלוקת Tensor Parallel כדי לטעון אותו ואת טבלת ה־KV של חלון ההקשר המלא.

ספריות כמו vLLM מגרסה 0.10.2 או SGLang מגרסה 0.5.2 תומכות בו ישירות, כולל תמיכה בחיזוי מרובה טוקנים שמאיץ את התגובה. אם אין לכם גישה לשרת עם ארבעה מעבדים גרפיים ייעודיים, אין טעם להסתבך עם התקנה מקומית ועדיף לפנות לנקודת קצה מנוהלת בענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-Next-80B-A3B-Instruct")
print(pipe("שלום"))

הקבצים

51 קבצים במאגר, 152 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי דרישה לפתוח את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗