GPT
Q

Qwen3.6-27B-MTP-pi-tune-GGUF

קוד פתוח

bytkimapache-2.02026-06-02

  • gguf
  • llama.cpp
  • qwen
  • qwen3_6
  • mtp

גרסת GGUF ייעודית לסוכני קוד מקומיים שמדלגת לחלוטין על בלוק החשיבה. היא מחזירה מיד פקודות וקריאות לכלים, וכוללת מנגנון חיזוי מרובה טוקנים שמאיץ את הריצה בתחנת עבודה.

  • 213 GBמשקל הקבצים
  • 329,399הורדות בחודש
  • 127לייקים

מה זה

בסיס המודל הוא Qwen3.6 בגודל 27 מיליארד פרמטרים, שעבר כוונון עדין בשיטת 4-bit QLoRA על גבי נתוני ריצה אמיתיים של סוכני תוכנה. בניגוד למודלים שפולטים שרשרת מחשבה ארוכה לפני שהם פועלים, האימון כאן נעל את נתיב התגובה הישיר. הוא פולט ישר עריכות קוד, קריאות לפונקציות ופקודות טרמינל, בלי לעכב את תהליך הריצה המקומי.

הייחוד הטכני הוא שילוב של MTP, חיזוי מרובה טוקנים, שבו ראשי הניבוי נשמרו בדיוק Q8_0 בכל רמות הדחיסה. במדידות פנימיות של היוצר נרשמה קבלת טיוטות של כ־78 אחוזים עם שלושה צעדי ניבוי וארבעה טוקנים, מה שהניב קצב פענוח גולמי של כ־40 טוקנים לשנייה וקצב עיבוד קלט של כ־615 טוקנים לשנייה. תמיכת הראייה נשמרה מהמודל המקורי, אך מחייבת קובץ mmproj נפרד.

מתאים ל

  • סוכן טרמינל מקומי

    הרצת פקודות shell, בדיקות סביבה והתקנת חבילות בלולאה מהירה ללא השהיות חשיבה.

  • תיקון ועריכת קוד

    עדכון קבצים ומענה ישיר למשוב מבדיקות אוטומטיות ישירות מתוך עורך הקוד.

  • קריאות לפונקציות בכלים

    פליטת מבני נתונים ישירים להפעלת כלי אוטומציה ודבופס מקומיים.

איפה זה נופל

המודל מוגדר מראש ללא שלב חשיבה פנימי. היוצר עצמו ממליץ על גרסת ה־reasoning הנפרדת אם המטרה היא פתרון בעיות קוד מורכבות שדורשות תכנון מקדים, ומבהיר שהגרסה הזו מיועדת רק למהירות תגובה ישירה. בנוסף, כרטיס המודל אינו מכיל מדדי הצלחה במשימות קוד, אלא רק נתוני מהירות, כך שאיכות הפלט בפועל דורשת בדיקה עצמאית. הפעלת מנגנון ה־MTP מגבילה את השרת לתהליך יחיד, וחיבור תמונות דורש ניהול ידני של קובץ מקרן נפרד שלא מגיע בחבילה.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לראייה ממוחשבת?

כן, המודל שומר על יכולות המולטימודל של מודל הבסיס. כדי להפעיל אותן צריך להוריד בנפרד קובץ תואם בשם mmproj-F16.gguf ולטעון אותו יחד עם קובץ השפה בשרת.

האם כדאי להעדיף את גרסת הנימוק על פני גרסה זו?

אם משימות הקוד שלך מסובכות ודורשות תכנון שלבי עמוק, היוצר ממליץ על גרסת ה־reasoning. הגרסה הזו מתאימה רק כאשר זמן התגובה בלולאת הסוכן הוא השיקול המוביל.

איך מריצים

כדי להריץ אותו מקומית עם כל היתרונות של הניבוי המהיר, צריך גרסה עדכנית של llama.cpp שתומכת בדגל draft-mtp. גרסת Q4_K_M דורשת קובץ של 17 גיגה בייט וכ־19 גיגה בייט זיכרון כרטיס מסך, כך שכרטיס של 24 גיגה בייט יספיק לריצה מלאה בהקשר סביר. אם יורדים לגרסאות דחוסות יותר כמו Q3 או Q2 אפשר להסתפק בפחות זיכרון, אך באיבוד איכות.

מי שמשתמש ב־MTP מוגבל כרגע לחריץ בודד ללא תמיכה בבקשות מקבילות. אם המטרה היא להריץ שרת מרכזי עם משתמשים רבים בו זמנית, המודל הזה בתצורה הזו לא מתאים, ועדיף להשתמש ב־API מנוהל.

ollama run hf.co/bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון Apache 2.0 מאפשר שימוש חופשי בקוד ובמשקלים, כולל התאמה אישית, שינויים והפצה מסחרית במוצרים סגורים. התנאים העיקריים דורשים שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים, וציון ברור אם נעשו בהם שינויים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗