GPT
Q

Qwen/Qwen3-Coder-Next-GGUF

קוד פתוח

Qwenapache-2.02026-02-02

  • transformers
  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל קוד עם ארכיטקטורת מומחים שמפעילה רק 3 מיליארד פרמטרים בכל טוקן מתוך 80 מיליארד. הוא מיועד לסוכני פיתוח שצריכים לרוץ מהר, להפעיל כלים ולתקן שגיאות ריצה בתוך חלון הקשר ענק.

  • 438 GBמשקל הקבצים
  • 15,822הורדות בחודש
  • 280לייקים

מה זה

מדובר במודל שתוכנן מראש עבור סוכני תכנות עצמאיים ועבודה מקומית. המבנה שלו מבוסס על 512 מומחים כשבכל רגע נתון פועלים רק עשרה מומחים רגילים ועוד אחד משותף, לצד שילוב של שכבות Gated DeltaNet ו־Attention. השילוב הזה נותן מהירות חישוב של מודל קטן עם מאגר הידע של מודל גדול, מה שמאפשר לו להתמודד עם משימות ארוכות טווח של כתיבת קוד.

הוא מגיע עם חלון הקשר טבעי של 262,144 טוקנים, ואפשר למתוח אותו אפילו יותר בעזרת YaRN. המטרה המרכזית כאן היא חיבור ישיר לסביבות פיתוח כמו Cline, Trae או Claude Code, כשהוא מתמקד בשימוש בכלים, קריאה לקבצים ותיקון עצמי כשפקודות נכשלות, במקום סתם להשלים שורות קוד בודדות.

מתאים ל

  • סוכן לתיקון באגים ב־IDE

    התמחות בהפעלת כלים והתאוששות מכישלונות הרצה מאפשרת לו לפעול בתוך כלים כמו Cline כדי לתקן פרויקטים שלמים.

  • ניתוח בסיסי קוד גדולים

    חלון הקשר של 256k טוקנים מאפשר להזין תיעוד רחב, ספריות שלמות ומבנה תיקיות בלי לחתוך את הקלט.

  • שרת פיתוח מקומי חסכוני

    אקטיבציה של 3B פרמטרים בלבד בכל טוקן מייצרת זמני תגובה מהירים בהשוואה למודלים צפופים בגודל דומה.

איפה זה נופל

המודל תומך רק במצב ללא חשיבה. הוא לא מייצר בלוקים של תהליך מחשבה מקדים כמו דגמי reasoning מודרניים, ולכן אין אפשרות לראות את שלבי הביניים של הניתוח שלו לפני שהוא פולט קוד או קורא לכלי. בנוסף, אף על פי שההקשר מגיע תיאורטית ליותר ממאתיים אלף טוקנים, החברה מציינת בדיקות מעשיות בעזרת YaRN רק עד 131,072 טוקנים, כך שמעבר לזה הביצועים עלולים להידרדר. היעדר תמיכה בשפה העברית בכרטיס המודל אומר שתצטרכו לבדוק בעצמכם איך הוא מתמודד עם הערות או תיעוד בעברית.

אותה משפחה

Qwen3-Coder-Next יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לבקש מהמודל לחשוב לפני שהוא עונה?

לא. הכרטיס מציין במפורש שהמודל עובד אך ורק במצב ללא חשיבה, והוא אינו מייצר תגיות think. אין צורך להגדיר דגלים לביטול חשיבה, המנגנון פשוט לא קיים בו.

האם כרטיס מסך בודד של 16GB יספיק להרצה?

לא עבור כל המודל. אף על פי שרק 3B פרמטרים מופעלים בכל רגע, כל 80B הפרמטרים חייבים לשבת בזיכרון, מה שדורש עשרות גיגה-בייט של RAM או VRAM גם בגרסאות מכווצות.

איך מריצים

ההרצה המקומית מתבצעת דרך llama.cpp, למשל עם קובצי קוונטיזציה כמו Q5_K_M שמחולקים לכמה חלקים. למרות שרק 3 מיליארד פרמטרים פעילים בחישוב, עדיין צריך להחזיק בזיכרון את כל 80 מיליארד הפרמטרים. כל המאגר שוקל 438 גיגה-בייט על פני 26 קבצים, כך שגרסה בודדת דורשת עשרות גיגות של זיכרון וידאו או שילוב של זיכרון מערכת מהיר.

אם אין לכם תחנת עבודה חזקה עם כרטיסי מסך מרובים, עדיף לפנות ל־API חיצוני שמארח את המודל. הרצה מקומית תדרוש שרשור נכון של הקבצים ב־llama-cli, הפעלת מנגנון Flash Attention ודגלים ייעודיים לגודל ההקשר שבו אתם עובדים בפועל.

ollama run hf.co/Qwen/Qwen3-Coder-Next-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

26 קבצים במאגר, 438 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים, הפצה ושילוב במוצרים פנימיים או חיצוניים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים וצירוף עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗