GPT
Q

froggeric/Qwen3.6-27B-MTP-GGUF

קוד פתוח

froggericapache-2.02026-05-05

  • llama.cpp
  • gguf
  • qwen3.6
  • qwen3_5
  • conversational

גרסת GGUF של Qwen3.6 עם תמיכה מובנית בחיזוי מרובה טוקנים. היא מיועדת למי שמריץ מודלים מקומית ורוצה מהירות כתיבה גבוהה בלי להקריב זיכרון על מודל טיוטה חיצוני.

  • 169 GBמשקל הקבצים
  • 17,000הורדות בחודש
  • 81לייקים

מה זה

מדובר במודל שכולל ראייה ממוחשבת, יכולות הרצת כלים ומצב חשיבה, כשהייחוד שלו הוא ראשי MTP צרובים במשקלים עצמם. הארכיטקטורה משלבת תשומת לב לינארית ברוב השכבות עם מנגנון קשב רגיל ב־16 שכבות בלבד מתוך 65, מה שחותך את תפיסת הזיכרון של ה־KV cache בכמעט פי ארבעה ביחס למודלים צפופים רגילים בגודל הזה.

המפרסם שילב תבנית ג'ינג'ה מתוקנת שמונעת קריסות של קריאות לכלים במנועי C פלוס פלוס ומטפלת נכון בתגיות חשיבה. בבדיקות כתיבת קוד על מעבד M2 Max, חיזוי הטוקנים מעלה את הקצב ב־31 אחוזים עד 171 אחוזים בהתאם לרמת הקוונטיזציה, פשוט כי טוקנים של קוד צפויים בהרבה מטקסט חופשי.

מתאים ל

  • פיתוח ובדיקת קוד מקומית

    קוד מניב שיעור קבלת טוקנים של עד 89 אחוזים בחיזוי, מה שמאיץ את התגובות משמעותית בכל רמת דחיסה.

  • עיבוד מסמכים ארוכים בתמונות

    שילוב של 262 אלף טוקנים עם מודל ראייה שוקל פחות זיכרון תודות לחלוקת השכבות הייחודית של המודל.

  • שרת תואם לממשקי סוכנים

    השרת המובנה תומך בפורמט של אנתרופיק ואופן איי איי כולל קריאות לכלים שתוקנו למנועי C פלוס פלוס.

איפה זה נופל

האצת ה־MTP תלויה לחלוטין בסוג המשימה. בכתיבה יוצרת או ניתוחים מורכבים בקוונטים הנמוכים מ־Q8, המנגנון מנחש לא נכון, זורק טוקנים, ולמעשה מאט את היצירה ב־1 עד 9 אחוזים ביחס לריצה רגילה.

המודל אינו נטען כלל בסביבות כמו Ollama או LM Studio נכון לעכשיו, בגלל היעדר תמיכה במנגנון הפיענוח הזה. בנוסף, חובה לפתוח את פרומפט המערכת בדיוק במשפט המקורי של עליבאבא, אחרת הביצועים צונחים, והתבנית המתוקנת עלולה לזרוק שגיאות בספריות מסוימות כמו oh-my-pi.

שאלות
נפוצות

האם כדאי להפעיל MTP בכל סוגי הריצות?

לא. במשימות יצירתיות על קוונטים כמו Q4 או Q5 החיזוי נכשל לעיתים קרובות ומאט את המודל. הפעילו אותו באופן קבוע בעיקר לקוד או אם אתם מריצים בקוונט Q8 ו־F16.

למה המודל לא עולה לי בתוך Ollama?

אולמה עדיין לא תומכת במנגנון פענוח ספקולטיבי מסוג MTP ולכן הקבצים לא מזוהים. נכון לעכשיו צריך להשתמש ישירות בשרת של llama.cpp מגרסה b9180 ומעלה.

איך מריצים

כדי להריץ אותו צריך גרסה b9180 ומעלה של llama.cpp. גרסת Q5_K_M שוקלת 18 גיגה־בייט ונחשבת לאיזון הנכון ביותר, ודורשת מחשב מק עם 32 גיגה זיכרון או כרטיס אנבידיה עם 24 גיגה לעבודה עם חלון קצר. לחלון המלא של 262 אלף טוקנים בקוונט הזה כבר נדרש מק של 48 גיגה או כרטיס עם 48 גיגה VRAM.

במכונות עם פחות מ־24 גיגה זיכרון גרפי, כמו מחשבים עם 16 גיגה, נאלצים לרדת לקוונטים נמוכים כמו IQ2_M ולוותר על הראייה לחלוטין. אם אין לכם חומרה ייעודית כזו ונדרש חלון הקשר ענקי עם ראיית תמונה, עדיף להשתמש ב־API חיצוני.

ollama run hf.co/froggeric/Qwen3.6-27B-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗