GPT
Q

Qwen3-Coder-Next

קוד פתוח

Qwenapache-2.02026-01-30

  • transformers
  • safetensors
  • qwen3_next
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל קוד פתוח שמכוון ישירות לסוכני פיתוח ועבודה בתוך סביבות עבודה. הוא מחזיק 80 מיליארד פרמטרים אבל מפעיל בפועל רק שלושה מיליארד בכל שלב, מה שחותך את עלויות החישוב.

  • 80Bפרמטרים
  • 262,144טוקנים בהקשר
  • 148 GBמשקל הקבצים
  • 401,572הורדות בחודש

מה זה

במקום להפעיל את כל המשקלים בכל טוקן, הארכיטקטורה כאן מחלקת 80 מיליארד פרמטרים בין 512 מומחים, ומפעילה עשרה בלבד בכל ריצה יחד עם רכיב משותף. בפועל זה נותן מהירות חישוב של מודל קטן עם מאגר הידע והיכולות של מודל גדול. השילוב של שכבות Gated DeltaNet יחד עם מנגנון קשב היברידי מאפשר לו לעכל הקשר של עד 262,144 טוקנים, שזה מספיק בשביל לטעון ריפו שלם, תיעוד והיסטוריית בדיקות בלי לקטוע את השיחה.

המודל אומן במיוחד סביב תהליכים של סוכנים, כמו פירוק משימות ארוכות טווח, הפעלת כלים חיצוניים והתאוששות משגיאות ריצה של קוד. הוא מתחבר ישירות לתבניות סביבת עבודה ולכלים קיימים כמו Claude Code, Cline, Trae או Kilo. המטרה שלו היא לא סתם להשלים שורת פייתון, אלא לקבל פקודה, לנסות להריץ, לראות שגיאה בקונסול ולתקן אותה בעצמו.

מתאים ל

  • סוכן תיקון באגים אוטונומי

    מבצע ריצות בדיקה, מזהה שגיאות פלט ומתקן את הקוד ישירות דרך כלי CLI ללא התערבות ידנית.

  • עבודה על מאגרי קוד ענקיים

    חלון של 256 אלף טוקנים מאפשר לטעון תיקיות פרויקט שלמות לצורך שינויים רוחביים.

  • הרחבות פיתוח ועורכי קוד

    מתחבר ישירות לממשקים כמו Cline או Trae כדי לקרוא לכלים חיצוניים ולנהל שינויי קבצים.

איפה זה נופל

הנקודה המרכזית שצריך לקחת בחשבון היא שהמודל עובד ללא מצב חשיבה. הוא לא מייצר בלוקים של תהליך מחשבה לפני התשובה, כך שאי אפשר לבחון את שרשרת ההיגיון הפנימית שלו לפני שהוא פולט קוד או קורא לכלי. בנוסף, חלון ההקשר המלא של 256K זולל משאבי זיכרון קיצוניים, ובמקרים רבים של עומס תצטרכו להגביל אותו ידנית לטווחים קצרים יותר כדי למנוע קריסות שרת.

אותה משפחה

Qwen3-Coder-Next יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בהצגת תהליך המחשבה שלו?

לא. המודל עובד אך ורק במצב ללא חשיבה ואינו מייצר תגיות חשיבה כלל. הוא מפיק את הקוד או את קריאות הכלים ישירות כפלט סופי.

מה אפשר לעשות אם השרת קורס מחוסר זיכרון בזמן ההרצה?

ברירת המחדל מנסה להקצות מקום לחלון ענק של 256K טוקנים. אם השרת נופל, מומלץ להוריד את גודל ההקשר בהגדרות ל־32,768 טוקנים.

באילו מנועים מומלץ להשתמש כדי להרים ממנו שרת?

התיעוד ממליץ על גרסאות עדכניות של sglang מגרסה 0.5.8 ומעלה או vLLM מגרסה 0.15.0 ומעלה, עם הגדרת מפענח הכלים הייעודי של המודל.

איך מריצים

כדי להריץ את המודל המלא בדיוק bfloat16 תצטרכו לאחסן 148 גיגה בייט של משקלים בזיכרון, מה שמחייב שרת עם כמה מאיצים גרפיים חזקים. ההרצה נעשית דרך מנועים כמו sglang או vLLM עם חלוקת מקביליות טנסורית, למשל על ארבעה מעבדים גרפיים, כשיש תמיכה מובנית גם בפרסר לקריאות כלים של הסדרה הזו.

אם השרת שלכם נתקל בנפילות זיכרון, ההמלצה הישירה של המפתחים היא לחתוך את חלון ההקשר ממאתיים חמישים ושש אלף טוקנים לאזור השלושים ושניים אלף. למי שאין אשכול שרתים ייעודי, שימוש באפליקציות שמריצות גרסאות מכווצות כמו llama.cpp, Ollama או KTransformers יהיה הרבה יותר הגיוני מחומרה מלאה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-Coder-Next")
print(pipe("שלום"))

הקבצים

52 קבצים במאגר, 148 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו במוצר פנימי או למכור שירותים שנשענים עליו, בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗