GPT
Q

Qwen3-Next-80B-A3B-Instruct-GGUF

קוד פתוח

unslothapache-2.02025-11-28

  • transformers
  • gguf
  • qwen3_next
  • text-generation
  • unsloth

ארכיטקטורת תערובת מומחים שמפעילה רק 3 מיליארד פרמטרים מתוך 80 מיליארד בכל רגע. היא נותנת מהירות ריצה גבוהה במיוחד יחד עם חלון הקשר ענקי של 262,144 טוקנים.

  • 262,144טוקנים בהקשר
  • 1.2 TBמשקל הקבצים
  • 32,661הורדות בחודש
  • 198לייקים

מה זה

מדובר במודל MoE עם 512 מומחים שמתוכם 10 פעילים בכל טוקן, לצד שילוב של Gated DeltaNet וקשב רגיל. המבנה ההיברידי הזה מיועד לעקוף את צוואר הבקבוק החישובי הרגיל של חלונות הקשר ארוכים, ומאפשר לו לעבד טקסטים של מאות אלפי טוקנים בלי לקרוס בעלויות החישוב.

במבחני ביצועים הוא עוקף את דגם 32B הרגיל כמעט בכל מדד, ובמשימות תכנות כמו LiveCodeBench הוא מגיע לציון 56.6 לעומת 51.8 של דגם 235B הגדול בהרבה. מצד שני, במשימות שדורשות הבנה מעמיקה של סביבות ארגוניות או סוכנים מורכבים כמו TAU2-Telecom, הוא משיג רק 13.2, פחות מחצי מהדגמים הגדולים.

מתאים ל

  • ניתוח מסמכי ענק

    חלון בסיסי של 262,144 טוקנים מאפשר להזין תיקי מסמכים שלמים בלי לחתוך מידע.

  • כתיבת קוד ובדיקות

    תוצאה של 56.6 ב־LiveCodeBench מציבה אותו מעל מודלים כבדים בהרבה בתחום התכנות.

  • שרת שירות מהיר

    הפעלה של 3 מיליארד פרמטרים בלבד בכל צעד נותנת קצב הפקת טוקנים גבוה ביחס לגודל.

איפה זה נופל

המודל תומך רק במצב הנחיות רגיל ולא מייצר בלוקים של חשיבה לפני תשובה. המשמעות היא שאין לו מנגנון הפשטה עצמי לבעיות לוגיות סבוכות. בנוסף, ביצועי הסוכן שלו חלשים מאוד בתרחישים מסוימים, עם ציונים של 13.2 בלבד במבחני תקשורת לעומת מודלים מבוססים. אם תרצו להרחיב את ההקשר למיליון טוקנים באמצעות YaRN סטטי, הכרטיס מזהיר במפורש שהדיוק בטקסטים קצרים עלול להיפגע.

אותה משפחה

Qwen3-Next יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל כולל תגיות חשיבה כמו דגמי ריזונינג מודרניים?

לא. המודל פועל במצב הנחיות רגיל בלבד ואינו מייצר בלוקים של חשיבה בפלט שלו.

איך מרחיבים את ההקשר למיליון טוקנים?

מגדירים מנגנון YaRN עם פקטור 4 בקונפיגורציה או דרך מנוע ההרצה. שימו לב שהגדרה קבועה כזו עלולה לפגוע באיכות התשובות בטקסטים קצרים.

איך מריצים

כדי להרים אותו מקומית צריך מנוע ייעודי כמו SGLang בגרסה 0.5.2 ומעלה או vLLM מגרסה 0.10.2. ההרצה המומלצת דורשת מערך של 4 מעבדים גרפיים במקביל כדי להחזיק את כל המשקלים בזיכרון, במיוחד אם רוצים לנצל את חלון ההקשר המלא של 256K טוקנים.

בנוסף, transformers הרגיל עוד לא תומך בחיזוי מרובה טוקנים למודל הזה. אם אין לכם שרת עם ארבעה כרטיסים חזקים לפחות, עדיף לפנות לנקודת קצה מנוהלת בענן במקום לנסות לדחוס 80 מיליארד פרמטרים על חומרה ביתית.

ollama run hf.co/unsloth/Qwen3-Next-80B-A3B-Instruct-GGUF:Q5_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

41 קבצים במאגר, 1.2 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו במוצר שלכם, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗