GPT
Q

Qwen3-Next-80B-A3B-Thinking-FP8

קוד פתוח

Qwenapache-2.02025-09-22

  • transformers
  • safetensors
  • qwen3_next
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

זה מודל חשיבה עם שמונים מיליארד פרמטרים שדורש חישוב של שלושה מיליארד בלבד בכל טוקן. מקבלים יכולות היסק כבדות בלי לפשוט רגל על זמני ריצה ותשתית.

  • 81Bפרמטרים
  • 262,144טוקנים בהקשר
  • 76.4 GBמשקל הקבצים
  • 2,953הורדות בחודש

מה זה

הארכיטקטורה כאן חריגה. יש פה מודל תערובת מומחים עם 512 מומחים שמפעיל רק 10 מהם בכל רגע נתון, בשילוב מנגנון קשב היברידי של Gated DeltaNet וקשב רגיל. זה מאפשר לו להתמודד עם הקשר מקורי של 262,144 טוקנים, ואפילו עד מיליון טוקנים בהרחבה, בלי צוואר הבקבוק החישובי הרגיל שחונק מודלים בגודל כזה.

התוצאות במבחנים מראות שהוא עוקף את Gemini-2.5-Flash Thinking ואת Qwen3-32B במבחני מתמטיקה כמו AIME25 עם ציון 87.8, ובקוד ב־LiveCodeBench עם 68.7. המודל מכויל לחשיבה ארוכה מאוד לפני תשובה, מה שדוחף את הביצועים קדימה במשימות תכנות והיסק סבוכות ביחס למודלים של שלושים מיליארד פרמטרים.

מתאים ל

  • פתרון בעיות קוד ואלגוריתמים

    הוא משיג 68.7 ב־LiveCodeBench ומצטיין בניפוח שרשרת חשיבה לפתרון בעיות תכנות מורכבות.

  • סוכנים אוטונומיים מורכבים

    ביצועים חזקים במבחני TAU ואינטגרציה מובנית עם ספריות כלים מאפשרים לו לנהל פעולות רב שלביות.

  • ניתוח מסמכי ענק

    תמיכה מובנית ב־262 אלף טוקנים עם קשב היברידי מאפשרת עיבוד תיעוד טכני נרחב בריצה מהירה.

איפה זה נופל

הוא עובד אך ורק במצב חשיבה. אין אפשרות לכבות את זה ולקבל תגובה מיידית, ותבנית השיחה מכריחה פתיחה של תגיות חשיבה. תהליך ההיסק מייצר לעיתים בלוקים ארוכים במיוחד של שרשרת מחשבה, מה ששורף טוקנים על משימות פשוטות ומאט את המענה הראשוני.

בעיה נוספת היא הרחבת ההקשר. שימוש ב־YaRN סטטי כדי לחצות את רבע מיליון הטוקנים עלול לפגוע באיכות הפלטים על טקסטים קצרים, והרמת הפרמטר presence_penalty לצמצום חזרתיות גורמת לעיתים לערבוב שפות ולנפילה בדיוק.

אותה משפחה

Qwen3-Next יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר לבטל את תהליך החשיבה כדי לקבל תשובות מהירות?

לא. המודל תומך רק במצב חשיבה, ותבנית הנתונים מוסיפה תגית חשיבה כברירת מחדל. אם אתם צריכים צ'אט מהיר לפעולות פשוטות, הוא לא מתאים לכם.

איך מטפלים בהיסטוריית שיחה שלא תעמיס על הזיכרון?

לפי ההנחיות, בשיחות מרובות שלבים צריך לחתוך את בלוק המחשבה מההיסטוריה ולהשאיר רק את התשובה הסופית. התבנית הרשמית עושה את זה לבד, אבל במערכת עצמאית אתם צריכים לוודא שהטוקנים של החשיבה לא נשלחים שוב.

כמה זיכרון דורשת הרחבת ההקשר למיליון טוקנים?

המודל מגיע מהקופסה עם רבע מיליון טוקנים, והרחבה למיליון דורשת הגדרת YaRN ברמת המנוע. זה דורש משאבי זיכרון וידאו עצומים שעלולים להוביל לשגיאות מחסור בזיכרון, ולכן היצרן ממליץ להגדיל את המקדם רק לפי הצורך המדויק.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־76.4 גיגה בייט בפורמט FP8 מכויל. להרצה מקומית מלאה בהקשר המרבי תצטרכו שרת עם 4 כרטיסי מסך, לפי פקודות ההרצה הרשמיות ב־vLLM או SGLang שמשתמשות ב־tensor parallel של 4. מומלץ להשתמש בגרסאות פיתוח עדכניות של המנועים האלה כדי לקבל תמיכה במנגנון ה־MTP להאצת הריצה.

אם אין לכם אשכול ייעודי של כרטיסי מסך מתאימים, אין טעם לנסות לדחוף את זה למחשב בודד. במקרים כאלה עדיף לגשת אליו דרך שירות ענן או ספק שמארח אותו ישירות דרך ממשק תואם OpenAI.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-Next-80B-A3B-Thinking-FP8")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להריץ אותו פנימית ולשלב אותו במוצרים שלכם בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗