GPT
Q

Qwen3-Coder-Next-Opus-4.6-Reasoning-Distilled-GGUF

קוד פתוח

samuelcardilloapache-2.02026-04-02

  • gguf
  • qwen3
  • reasoning
  • distillation
  • claude-opus

גרסת קוד מקומית שעברה זיקוק חשיבה מ־Opus 4.6, ומיועדת למי שרוצה הפעלת כלים ואיתור באגים ברמה גבוהה.

  • 427 GBמשקל הקבצים
  • 1,146הורדות בחודש
  • 43לייקים

מה זה

מדובר בכיוונון מלא של מודל MoE עם שמונים מיליארד פרמטרים כוללים, שרק כשלושה מיליארד מהם פעילים בכל טוקן. הזיקוק נעשה על בסיס נתוני חשיבה מ־Claude Opus 4.6, מה שנותן למודל בלוקי חשיבה פנימיים לפני הפקת התשובה. השוני המרכזי מול מודל הבסיס הוא זינוק בהפעלת כלים, שם הציון קפץ מ־3.4 ל־7.2 מתוך 10, ושיפור מסוים בכתיבת קוד ובאיתור באגים מורכבים. במקום לפלוט קריאה בודדת ולעצור, הוא מתכנן שרשרת צעדים ומסביר את המעברים ביניהם.

בכרטיס המודל רואים גם את המחיר של הזיקוק הזה. המודל פחות טוב בהיצמדות להוראות מחמירות, ציונו ירד ל־7.0 לעומת 7.7 בבסיס, והוא נחלש בפתרון בעיות הסתברות ולוגיקה טהורה עקב נטייה לשגות בחישובים מורכבים ולבזבז תקציב טוקנים על הקדמות. במדידות מהירות על כרטיס שרת, הוא הפיק 102.5 טוקנים לשנייה עם תשובות ארוכות יותר מהמקור.

מתאים ל

  • סוכן לפיתוח תוכנה

    תכנון שרשראות קריאה לפונקציות וביצוע משימות מרובות שלבים במסדי נתונים ו־APIs.

  • סקירת קוד ואיתור באגים

    זיהוי בעיות מורכבות כמו מרוצי תהליכים, דליפות זיכרון ופרצות אבטחה בליווי הסברים מפורטים.

  • עוזר מקומי בארגון סגור

    כתיבת קוד בסביבה מבודדת שאינה מאפשרת שליחת מידע לשרתים חיצוניים, על גבי שרת מקומי חזק.

איפה זה נופל

הבעיה הבולטת ביותר היא חוסר ציות להגבלות פורמט נוקשות. במבחן פלט של JSON בלבד המודל נכשל ופלט מעל אלפיים טוקנים עם טקסט מיותר, בעוד מודל הבסיס החזיר מבנה נקי. בנוסף, נרשמו טעויות בחישובים מתמטיים כמו שרשראות מרקוב, והמודל נוטה להאריך בדיבור ולבזבז טוקנים על חשיבה מיותרת במקום לגשת לפתרון. מי שבונה עליו לפלט מובנה באוטומציות יצטרך לבצע סינון קפדני.

שאלות
נפוצות

האם המודל תומך בעברית לכתיבת קוד?

המודל אומן והוגדר עבור השפה האנגלית בלבד. הוא מסוגל לקרוא קוד, אך כל נתוני הזיקוק וההנחיות שלו מתבססים על אנגלית, ולכן לא מומלץ להסתמך עליו לפיתוח או תיעוד בעברית.

למה חובה להשתמש בתבנית השיחה המצורפת?

האימון הוסיף תגיות חשיבה ייחודיות שאינן נתמכות בתבנית הרגילה של Qwen3. ללא הקובץ הייעודי, שרת ההרצה לא יידע להפריד בין החשיבה הפנימית לתשובה הסופית, והפעלת הכלים תשתבש.

איך מריצים

כדי להריץ אותו צריך חומרה ייעודית וכבדה. הגרסה הקלה ביותר, MXFP4, דורשת 42 ג'יגה־בייט ונכנסת בכרטיס עם 48 ג'יגה זיכרון כמו RTX 4090 יחיד או A6000, בעוד גרסאות איכותיות כמו Q8 דורשות כרטיס של 96 ג'יגה, ודיוק מלא של BF16 דורש שני כרטיסי 96 ג'יגה. המודל רץ דרך llama-server, ומחייב שימוש בתבנית השיחה המצורפת כדי להפריד את תוכן החשיבה מהתשובה הגלויה ולתמוך בהפעלת כלים.

אם אין לכם כרטיס מקצועי עם לפחות 48 ג'יגה זיכרון גרפי פנוי, אין טעם לנסות להריץ אותו מקומית. במצב כזה עדיף לשלם על API מסחרי חיצוני, כי הרצה מקומית על מעבד או חומרה ביתית רגילה פשוט לא תזוז עם מודל של שמונים מיליארד פרמטרים.

ollama run hf.co/samuelcardillo/Qwen3-Coder-Next-Opus-4.6-Reasoning-Distilled-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה חופשית בתוך מוצרים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו. אין חובה לפתוח את הקוד של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗