GPT
Q

Qwen3-Next-80B-A3B-Instruct-FP8

קוד פתוח

Qwenapache-2.02025-09-22

  • transformers
  • safetensors
  • qwen3_next
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת FP8 של מודל תערובת מומחים שמפעילה רק 3 מיליארד פרמטרים מתוך 80 מיליארד בכל טוקן. מתאים למי שצריך חלון הקשר ענקי בריצה מקומית מהירה יחסית.

  • 81Bפרמטרים
  • 262,144טוקנים בהקשר
  • 76.4 GBמשקל הקבצים
  • 159,928הורדות בחודש

מה זה

הארכיטקטורה משלבת מנגנון קשב היברידי בין Gated DeltaNet לבין Gated Attention עם מנגנון מומחים דליל מאוד. מתוך 512 מומחים קיימים, המערכת מפעילה רק עשרה מומחים ומומחה משותף אחד בכל צעד, לצד שימוש בחיזוי מרובה טוקנים כדי להאיץ את הפלט. השילוב הזה מאפשר לו להציג מהירות תגובה גבוהה גם בהקשרים ארוכים במיוחד, כשהוא מגיע עם תמיכה מקורית של 262,144 טוקנים ויכולת הרחבה עד מיליון באמצעות YaRN.

במבחני ביצועים הוא עוקף את Qwen3-235B בכתיבת קוד עם ציון 56.6 ב־LiveCodeBench לעומת 51.8, ומגיע ל־82.7 ב־Arena-Hard לעומת 79.2. מצד שני, במשימות תכנון וסוכנים כמו TAU2-Telecom הוא משיג רק 13.2 לעומת 32.5 של הדגם הגדול, מה שמראה שהחיסכון בפרמטרים פעילים פוגע ביכולת להתמודד עם לוגיקה עסקית סבוכה.

מתאים ל

  • ניתוח מסמכים ארוכים

    קריאת תיעוד טכני וספרים שלמים בזכות חלון של 262,144 טוקנים ותמיכה בהרחבה עד מיליון.

  • יצירת קוד ותיקון באגים

    הוא משיג 56.6 ב־LiveCodeBench ועוקף מודלים כבדים בהרבה במשימות פיתוח.

  • שרת הסקה בתקציב מחשוב מוגבל

    הוא מפעיל רק 3 מיליארד פרמטרים לטוקן ומאפשר תעבורה גבוהה פי עשרה בהקשרים מעל 32K.

איפה זה נופל

המודל תומך רק במצב שיחה רגיל ולא מייצר שרשראות חשיבה סמויות. אם תפעילו הרחבת הקשר למיליון טוקנים עם YaRN סטטי, הדיוק על טקסטים קצרים עלול לרדת בגלל מנגנון הריווח הקבוע. בנוסף, העלאת פרמטר presence_penalty כדי למנוע חזרתיות גורמת לעיתים לערבוב שפות ולפגיעה באיכות הפלט. התוצאות שלו במשימות סוכן כמו TAU2 חלשות מאוד ביחס למודלים מלאים.

אותה משפחה

Qwen3-Next יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל כולל תהליך חשיבה פנימי לפני מענה?

לא. המודל פועל במצב instruct בלבד ואינו מייצר תגיות חשיבה. כל התשובות נכתבות ישירות ללא שלב ביניים גלוי.

כמה זיכרון GPU צריך כדי להריץ אותו בהקשר המקסימלי?

המשקלים דורשים כ־76.4 גיגהבייט לפני חישובי הקשב. להקשר מלא של 256K צריך ארבעה כרטיסים ייעודיים, ואם הזיכרון לא מספיק תצטרכו להגביל את ההקשר ל־32K.

איך מריצים

המשקל הכולל של הקבצים עומד על 76.4 גיגהבייט בפורמט FP8. כדי להרים שרת עם vLLM או SGLang בהקשר המלא של 256K צריך ארבעה כרטיסי מסך, כשפקודות ההפעלה הרשמיות מוגדרות מראש לחלוקה כזו באמצעות tensor parallel 4. אם השרת קורס בעלייה בגלל מחסור בזיכרון, ההמלצה הרשמית היא לחתוך את אורך ההקשר ל־32,768 טוקנים.

אם אין לכם שרת עם ארבעה מאיצים חזקים וזמינים, אין טעם להיאבק עם חומרה ביתית. במצב כזה עדיף לצרוך אותו דרך ספק ענן או API תואם OpenAI.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-Next-80B-A3B-Instruct-FP8")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, לשלב אותו במוצרים סגורים ולהפיץ אותו בחופשיות, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗