GPT
Q

Qwen3-Next-80B-A3B-Thinking-GGUF

קוד פתוח

unslothapache-2.02025-11-28

  • transformers
  • gguf
  • unsloth
  • text-generation
  • endpoints_compatible

מבנה מומחים דליל שמפעיל רק 3 מיליארד פרמטרים מתוך 80 מיליארד בכל שלב. הוא נותן יכולות חשיבה עמוקה וחלון הקשר של 262 אלף טוקנים בלי עלות החישוב הרגילה של מודל ענק.

  • 1.2 TBמשקל הקבצים
  • 9,910הורדות בחודש
  • 82לייקים

מה זה

מדובר בגרסת GGUF שעברה כימות על ידי Unsloth לארכיטקטורה שמשלבת מנגנון קשב היברידי וחלוקה ל־512 מומחים. המודל שומר על נפח זיכרון של מודל 80B, אבל בזמן ריצה מעבד רק 10 מומחים פעילים ועוד אחד משותף. זה מקצץ את כמות החישובים לכל טוקן ומאפשר תעבורה גבוהה גם בטקסטים ארוכים במיוחד.

המודל מיועד ספציפית למשימות שמצריכות שרשרת חשיבה מלאה. במבחני חשיבה מתמטית ותכנות כמו AIME25 ו־LiveCodeBench הוא עוקף את הדור הקודם של הסדרה, ומציג תוצאות שמתחרות גם במודלים קנייניים כמו Gemini-2.5-Flash Thinking, במיוחד בפתרון בעיות קוד ומענה מרובה שלבים.

מתאים ל

  • פתרון בעיות קוד מורכבות

    ציונים גבוהים ב־LiveCodeBench ו־CFEval יחד עם מנגנון חשיבה מובנה לניתוח שגיאות ובניית אלגוריתמים.

  • סוכני אוטומציה מרובי כלים

    תמיכה מובנית בקריאה לפונקציות וביצועים יציבים במבחני סוכנים כמו BFCL-v3 ו־TAU.

  • ניתוח מסמכים טכניים ארוכים

    חלון הקשר מקורי של 262 אלף טוקנים שמאפשר עיבוד מאגרי מידע שלמים בלי חלוקה גסה למקטעים.

איפה זה נופל

הוא עובד רק במצב חשיבה, והתבנית שלו מייצרת בלוקי חשיבה ארוכים במיוחד שלא מתאימים למי שמחפש תשובות קצרות ומהירות. בריצות רב־שלביות צריך לנקות ידנית את היסטוריית החשיבה מהזיכרון כדי לא לחנוק את ההקשר. הרחבה למיליון טוקנים באמצעות YaRN סטטי פוגעת ישירות באיכות התשובות על טקסטים קצרים, והעלאת מקדם ה־presence penalty לעצירת לולאות עלולה לגרום לערבוב שפות.

אותה משפחה

Qwen3-Next יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה הפלט של המודל נפתח ישירות בלי תגית think?

התבנית המובנית מוסיפה את התג הפותח באופן אוטומטי בהנחיית המערכת. לכן המודל פולט רק את תוכן החשיבה ואת תגית הסגירה, וזה תקין לחלוטין.

האם כדאי להפעיל תמיכה במיליון טוקנים כברירת מחדל?

לא. מנגנון YaRN מיושם בצורה סטטית, מה שפוגע בביצועים ובדיוק של המודל על קלטים קצרים. מומלץ להפעיל אותו רק כשבאמת מעבדים מסמכי ענק.

איך מריצים

המשקל הכולל של הקבצים במאגר מגיע ל־1.2 טרה בייט, שמחולקים ל־40 קבצים ומכילים מגוון רחב של רמות כימות. כדי להריץ את המודל בהקשר המלא של 256 אלף טוקנים, תצטרכו שרת עם 4 כרטיסי מסך מודרניים ותמיכה ב־Tensor Parallelism דרך מנועים כמו vLLM או SGLang.

אם אתם צריכים רק שאילתות קצרות או משימות נקודתיות בלי חומרה ארגונית ייעודית, אין הצדקה אמיתית להחזיק אשכול שרתים כזה עצמאית. במקרה כזה עדיף לגשת ישירות לנקודת קצה מנוהלת דרך API ולשלם לפי שימוש.

ollama run hf.co/unsloth/Qwen3-Next-80B-A3B-Thinking-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

40 קבצים במאגר, 1.2 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ ברישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי קוד, הפצה והטמעה מלאה במוצרים סגורים, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗