GPT
Q

Qwen3-Next-80B-A3B-Thinking

קוד פתוח

Qwenapache-2.02025-09-09

  • transformers
  • safetensors
  • qwen3_next
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל חשיבה עם שמונים מיליארד פרמטרים שמעיר רק שלושה בכל טוקן. הוא נועד לפתור בעיות מורכבות של קוד ומתמטיקה בלי זמני הריצה הכבדים של מודלים צפופים.

  • 81Bפרמטרים
  • 262,144טוקנים בהקשר
  • 152 GBמשקל הקבצים
  • 46,262הורדות בחודש

מה זה

הארכיטקטורה כאן משלבת מנגנון קשב היברידי בין שכבות דלתא נט לשכבות קשב רגילות, יחד עם חלוקה לחמש מאות ושנים עשר מומחים שמתוכם פועלים רק עשרה בו זמנית. השילוב הזה שומר על קיבולת רחבה מאוד בזמן שהחישוב בפועל זול בהרבה, מה שמאפשר תפוקה מהירה גם כשהקלט מתארך מעבר לשלושים ושניים אלף טוקנים. הוא אומן על חמישה עשר טריליון טוקנים ומגיע עם חלון הקשר טבעי של מאתיים שישים ושניים אלף טוקנים.

במדדי ביצועים המודל מציג תוצאות גבוהות במיוחד בחשיבה מתמטית ותכנות. הוא קיבל 87.8 במבחן AIME25 וציון של 68.7 ב־LiveCodeBench, מעל מודלים מתחרים כמו Gemini-2.5-Flash-Thinking. לצד זה, בבדיקות ידע רחב ורב־לשוניות כמו GPQA או INCLUDE, הוא עדיין מפגר מעט אחרי מודלים ענקיים כמו גרסת המאתיים שלושים וחמישה מיליארד פרמטרים מאותה משפחה.

מתאים ל

  • פתרון אלגוריתמים וכתיבת קוד

    התוצאות הגבוהות במבחני תכנות הופכות אותו למנוע מצוין לבדיקת באגים ופתרון בעיות קוד קשות שדורשות תכנון שלבי.

  • ניתוח מסמכים ארוכים

    חלון של 262 אלף טוקנים והקשב ההיברידי מאפשרים לסרוק תיקי מסמכים גדולים בלי קריסה של זמני העיבוד.

  • סוכני אוטונומיה מרובי שלבים

    ציונים של מעל 60 במבחני TAU2 ו־72 ב־BFCL מראים יכולת חזקה בהפעלת כלים חיצוניים וקבלת החלטות עקבית.

איפה זה נופל

המודל פועל אך ורק במצב חשיבה ולא מסוגל להחזיר תשובה מהירה ופשוטה בלי לפתוח תהליך הסקה ממושך. הוא נוטה לייצר בלוקי מחשבה ארוכים במיוחד, מה שמייקר את כמות הטוקנים הנפלטים ומאט את המענה בפניות פשוטות. נוסף על כך, הרחבת חלון ההקשר מעבר לטבעי באמצעות YaRN סטטי עלולה לפגוע בדיוק בטקסטים קצרים, והעלאת מקדם הנוכחות לצמצום חזרות גורמת לעיתים לערבוב שפות ולפגיעה בתוצאה.

אותה משפחה

Qwen3-Next יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר לבטל את שרשרת המחשבה כדי לקבל תשובה קצרה?

לא. המודל תוכנן לעבוד אך ורק במצב חשיבה ותבנית השיחה מוסיפה אוטומטית את תגית הפתיחה. אם תנסו לחסום את זה, התשובות יאבדו מהאיכות שלהן והוא לא יפעל כמצופה.

כמה זיכרון כרטיס מסך נחוץ כדי להריץ אותו?

המשקלים דורשים לפחות 160 ג'יגה־בייט רק בשביל המודל עצמו לפני חישוב הזיכרון עבור הקשר ארוך. בפועל תצטרכו שרת עם ארבעה כרטיסי 80 ג'יגה־בייט כדי לקבל ביצועים סבירים בטווח ההקשר המלא.

איך שומרים על היסטוריית שיחה בלי לחרוג מהמכסה?

מומלץ לחתוך את תגיות החשיבה מכל סיבוב קודם ולהשאיר בהיסטוריה רק את התשובה הסופית. התבנית המובנית עושה זאת מעצמה, אך בחיבור ישיר למנוע אחר עליכם לוודא שהמחשבות לא נשלחות שוב כקלט.

איך מריצים

כדי להעלות אותו באופן מקומי תצטרכו מערך של ארבעה כרטיסי מסך עם מקביליות טנזורים, מכיוון שמשקל הקבצים לבדו תופס 152 ג'יגה־בייט בדיוק bfloat16. מנועי הרצה ייעודיים כמו vLLM מגרסה 0.10.2 או SGLang מגרסה 0.5.2 הם דרישת חובה כאן כדי ליהנות מהתכונות של הארכיטקטורה, כולל מנגנון Multi-Token Prediction שמאיץ את ייצור התשובות.

הריצה דורשת הקצאת זיכרון משמעותית מאוד לחלון ההקשר המלא, והמפתחים ממליצים לא לרדת מ־131 אלף טוקנים כדי לא לפגוע בתהליך החשיבה. אם התשתית שלכם לא כוללת שרת ייעודי עם ארבעה מאיצים חזקים, החזקת מופע עצמאי תהיה יקרה ולא כלכלית לעומת פנייה לנקודת קצה מנוהלת.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-Next-80B-A3B-Thinking")
print(pipe("שלום"))

הקבצים

51 קבצים במאגר, 152 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0 המלא. אתם יכולים להריץ אותו, לשנות אותו, לשלב אותו בתוך מוצרים מסחריים ואפילו לגבות עליו תשלום ממשתמשי קצה, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗