GPT
Q

Qwen3-Coder-Next-FP8

קוד פתוח

Qwenapache-2.02026-02-01

  • transformers
  • safetensors
  • qwen3_next
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל קוד עם 80 מיליארד פרמטרים שמפעיל רק 3 מיליארד בכל טוקן. הוא נבנה לסוכני פיתוח עצמאיים ולעבודה ישירה מול כלי עריכה וטרמינל.

  • 80Bפרמטרים
  • 262,144טוקנים בהקשר
  • 74.9 GBמשקל הקבצים
  • 1,701,361הורדות בחודש

מה זה

מדובר במודל שמיועד מראש לכתיבת קוד ולהרצת משימות פיתוח מורכבות, עם תמיכה מובנית בחלון הקשר ענק של 262,144 טוקנים. הייחוד שלו טמון בארכיטקטורת תערובת מומחים קיצונית למדי, הכוללת 512 מומחים כשבפועל רק עשרה מהם מופעלים בכל רגע נתון לצד מומחה משותף אחד. השילוב הזה, יחד עם שכבות היברידיות של Gated DeltaNet ותשומת לב gated, מאפשר לו לספק יכולת חישוב מהירה משמעותית ביחס לגודל הכולל שלו.

הוא מכוון ישירות לעבודה עם סביבות פיתוח וסוכני שורת פקודה כמו Claude Code או Cline. ההתמקדות כאן היא על שימוש רציף בכלים, יכולת התאוששות עצמאית משגיאות הרצה, ומעקב אחרי הנחיות לאורך זמן בלי לאבד את ההקשר.

מתאים ל

  • סוכני פיתוח בטרמינל

    חיבור ישיר לכלים שמריצים פקודות ומתקנים קוד בזמן אמת, בזכות יכולת מובנית לקרוא פונקציות ולהתאושש משגיאות.

  • ניתוח בסיסי קוד גדולים

    טעינת פרויקטים שלמים לקונטקסט של 256k כדי לבצע שינויים מבניים חוצי קבצים בלי לחתוך חלקי מערכת.

  • שרת השלמות לארגון

    הרצה מקומית ומאובטחת של מודל קוד חזק על חומרת שרתים פרטית, ללא תלות בשירותי ענן סגורים.

איפה זה נופל

המודל הזה לא כולל מצב חשיבה, הוא פשוט לא מייצר בלוקים של תהליך מחשבה פנימי ולכן אל תצפו ממנו לפתור חידות היגיון שדורשות שלבי ביניים מפורשים. מעבר לכך, כל תוצאות הבנצ'מרק שפורסמו נמדדו על גרסת המשקל המקורית ולא על קובצי ה־FP8 שתורידו בפועל, כך שתיתכן שחיקה בביצועים. בעיית זיכרון היא עניין ודאי אם תנסו לפתוח את מלוא חלון ההקשר של 256 אלף טוקנים בלי חומרה מתאימה.

אותה משפחה

Qwen3-Coder-Next יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בחשיבה עמוקה עם תגיות think?

לא. הוא עובד במצב רגיל בלבד ואינו מייצר תגיות חשיבה בפלט. אין צורך להגדיר משתנים מיוחדים לביטול החשיבה, הוא מיועד לתת תשובות ישירות ולקרוא לכלים.

מה לעשות אם מקבלים שגיאת Out of Memory בזמן העלייה?

חלון ברירת המחדל עומד על 256k טוקנים ודורש זיכרון עצום לטבלאות ה־KV. הפתרון המהיר הוא להגביל את אורך ההקשר בהגדרות ההפעלה ל־32,768 טוקנים.

האם אפשר להריץ אותו דרך Ollama או llama.cpp?

כן, המודל נתמך בספריות מקומיות כמו Ollama, llama.cpp, KTransformers ו־MLX. עדיין תצטרכו כמות גדולה של זיכרון RAM או VRAM כדי להחזיק את 75 הגיגה בייט של המשקלים.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־74.9 גיגה בייט בפורמט FP8 מכויל מראש, כך שאין שום דרך להריץ אותו על כרטיס גרפי ביתי בודד. בשביל להעלות אותו עם מנועים כמו vLLM או SGLang תצטרכו מערך של כמה כרטיסים, כשחלוקה לשני כרטיסי שרת חזקים היא נקודת ההתחלה, או אפילו ארבעה כרטיסים אם אתם מתכוונים לנצל את מלוא חלון ההקשר.

אם השרת קורס בגלל מחסור בזיכרון, ההמלצה הישירה היא להגביל את ההקשר לאזור 32,768 טוקנים. למי שאין תשתית ייעודית בענן או שרת מקומי כבד, אין היגיון לנסות להחזיק את כל המשקל הזה לבד ועדיף להשתמש בנקודת קצה מנוהלת.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-Coder-Next-FP8")
print(pipe("שלום"))

הקבצים

52 קבצים במאגר, 74.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המלא. זה אומר שמותר לכם לעשות בו שימוש מסחרי, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗