GPT
Q

Qwen3.6-27B-A3B-Coder-MTP-GGUF

קוד פתוח

ManniX-ITAapache-2.02026-07-15

  • transformers
  • gguf
  • moe
  • code
  • expert-pruning

גרסה מכווצת וממוקדת קוד למודל המומחים של קוון, שחותכת את מספר המומחים ממאתיים חמישים וששה למאה שמונים וארבעה. מקבלים ביצועי פיתוח מעולים במשקל מופחת, בלי צורך באימון מחדש.

  • 409 GBמשקל הקבצים
  • 63,399הורדות בחודש
  • 39לייקים

מה זה

התהליך מאחורי הפרויקט הזה לקח את מודל הבסיס ודילל מתוכו שבעים ושניים מומחים בכל שכבה, תוך שמירה מכוונת על מומחים שמצטיינים בכתיבת קוד לפי מדדי LiveCodeBench ו־MultiPL-E. כדי לפצות על הדילול בלי אימון מחדש, הניתוב מפעיל עשרה מומחים לכל טוקן במקום שמונה כברירת מחדל.

התוצאה במספרים מראה שההימור הצליח במשימות תכנות: ציון של 0.840 ב־MultiPL-E, שעוקף אפילו את מודל המקור הגדול, לצד 0.970 ב־HumanEval. המחיר מגיע ביכולות כלליות יותר. במבחן IFEval למעקב אחר הוראות יש ירידה חדה מ־0.960 במקור ל־0.730 כאן, וגם ב־MATH-500 נרשמה נפילה מ־0.730 ל־0.620. זה מודל שנבנה כדי לכתוב תוכנה, ושם הוא מרוכז.

מתאים ל

  • השלמת קוד מקומית ב־IDE

    מציג דיוק של 0.97 ב־HumanEval ורץ ב־16 גיגה־בייט, מושלם לעבודה מקומית ומאובטחת.

  • תרגום קוד בין שפות

    ציון 0.840 ב־MultiPL-E מבטיח תמיכה רחבה ומדויקת ברוסט, ג'אווה וג'אווהסקריפט.

  • סקירת קוד ובדיקת באגים

    יכולת הסקת המסקנות מתמקדת בבדיקת לוגיקה תכנותית מבלי לבזבז זיכרון על מומחים כלליים.

איפה זה נופל

החולשה הבולטת ביותר היא הפעלת כלים וסוכנים אוטונומיים. במבחן tool-eval-bench המודל קיבל 123.2 נקודות בלבד והגיע למקום האחרון בקבוצה שלו, עם ציון נמוך של ארבעים אחוז בתכנון עצמאי וחמש עשרה תקלות בטיחות קריטיות בחמישה ניסיונות. הדיוק בתחביר הקריאות מושלם, אבל היכולת לנהל תהליך ארוך נפגעה קשות. בנוסף, יש לו נטייה לחפירה מוגזמת בשאלות פתוחות, עד כדי שאיבת כל חלון ההקשר במחשבות פנימיות אם לא תגבילו אותו מראש.

שאלות
נפוצות

למה המודל חופר ומחזיר טקסט ענק לפני שהוא עונה?

הוא יורש ממודל הבסיס נטייה לחשיבה ארוכה שעלולה למלא את כל ההקשר. ב־llama.cpp חובה להגדיר תקציב חשיבה כמו 8192 טוקנים עם משפט עצירה מתאים, כדי לעצור את שרשרת המחשבה בזמן.

האם כדאי להשתמש בו עבור סוכן אוטומטי שמפעיל פונקציות?

לא. המודל נכשל בתכנון משימות מורכבות והגיע למקום האחרון במבחני כלים עם 40% בלבד בתכנון. אם צריך יכולות סוכן באותה משפחה, עדיף להוריד את גרסת A3B-CoderX.

איזה קובץ להוריד מתוך כל הקבצים שבמאגר?

הקובץ המומלץ ביותר הוא CD-IQ4_K_M. הוא תופס בערך 16 גיגה־בייט ומספק איכות קוד זהה למשקל המקורי ללא איבוד דיוק מורגש.

איך מריצים

הגרסה המומלצת לפי המפתח היא CD-IQ4_K_M ששוקלת סביב 16 גיגה־בייט, ומציגה איכות זהה למשקל מלא במבחני קוד. בשבילה תצטרכו כרטיס מסך בודד עם 24 גיגה זיכרון כדי להחזיק את המודל יחד עם חלון הקשר סביר.

חובה להשתמש בגרסת llama.cpp עדכנית, לפחות b8508, כדי להגדיר נכון את מגבלת החשיבה עם דגל jinja ומשפט עצירה מתאים, אחרת המודל ימשיך לנמק בתוך התשובה הגלויה. שימו לב לבעיית דרייברים מוכרת: גרסאות IQ2_M ו־IQ3_M מייצרות פלט שבור לחלוטין על כרטיסי אנבידיה מסדרת בלקוול, כך שעל חומרה כזו עדיף להיצמד לגרסאות ה־K.

ollama run hf.co/ManniX-ITA/Qwen3.6-27B-A3B-Coder-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

57 קבצים במאגר, 409 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0, שמאפשר שימוש מסחרי מלא, שינוי קוד והפצה חופשית ללא תמלוגים. התנאי העיקרי הוא שימור הודעות זכויות היוצרים וצירוף עותק הרישיון בכל הפצה של הקבצים או המוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗