GPT
Q

Qwen3.6-27B-MTP-GGUF

קוד פתוח

unslothapache-2.02026-05-11

  • transformers
  • gguf
  • unsloth
  • qwen
  • qwen3_5

גרסת GGUF של Qwen3.6 בגודל 27B שכוללת Multi-Token Prediction. היא מיועדת למי שרוצה הסקת מסקנות מהירה פי שניים בלי לאבד דיוק בקוד ובמשימות מורכבות.

  • 405 GBמשקל הקבצים
  • 811,063הורדות בחודש
  • 1,310לייקים

מה זה

מדובר במודל שפה ותמונה עם 27 מיליארד פרמטרים, המשלב שכבות של Gated DeltaNet ו־Gated Attention. השינוי המרכזי כאן הוא שילוב מנגנון ה־MTP, שמאפשר להאיץ את קצב פליטת הטוקנים פי 1.5 עד פי 2 בהשוואה לגרסאות רגילות, ללא פגיעה בביצועים. הוא מציע תמיכה בתפקיד Developer לכלי פיתוח כמו Codex, וכולל שיפורים בניתוח אובייקטים מקוננים לקריאות לכלים חיצוניים.

המודל פועל כברירת מחדל עם מנגנון חשיבה מובנה שמייצר שרשרת הסקה לפני התשובה הסופית. נוספה לו יכולת לשמר את עקבות החשיבה של הודעות קודמות בהיסטוריית השיחה, מה שעוזר לשמור על עקביות תכנונית ולחסוך טוקנים בסוכנים אוטונומיים. חלון ההקשר הטבעי עומד על 262,144 טוקנים, וניתן להרחיב אותו בעזרת RoPE סקיילינג עד 1,010,000 טוקנים.

מתאים ל

  • סוכן תכנות לקבצי קוד

    הוא מנתח עצי תיקיות, מבצע קריאות לכלים עם מבנים מקוננים ושומר את רצף החשיבה הקודם.

  • פיתוח ממשקי קוד ב־Codex

    תמיכה בתפקיד מפתח והאצת MTP מקצרות זמני המתנה בבניית תהליכי עבודה לפרונטאנד.

  • עיבוד מסמכי ענק

    תמיכה מובנית ב־262,144 טוקנים מאפשרת לקרוא תיעוד טכני מלא בלי צורך בפיצול אגרסיבי.

איפה זה נופל

הבעיה הגדולה ביותר בהרצת המודל עם MTP ב־llama.cpp היא חוסר תמיכה בעיבוד תמונה או בהרצה מרובת תהליכים, כך שהיכולות המולטימודליות שלו מנוטרלות שם לחלוטין. כמו כן, קיצוץ חלון ההקשר מתחת ל־128 אלף טוקנים עלול לפגוע ביכולות החשיבה שלו, אך שמירה על חלון מלא גורמת מהר מאוד לשגיאות מחסור בזיכרון. הרחבת ההקשר מעבר לטווח הטבעי בעזרת YaRN היא סטטית, מה שפוגע בביצועים בטקסטים קצרים. העלאת מדד ה־presence penalty למניעת חזרות עלולה לגרום לערבוב שפות.

שאלות
נפוצות

למה כדאי להוריד את גרסת ה־MTP במקום את הגרסה הרגילה?

טכניקת Multi-Token Prediction חוזה מספר טוקנים קדימה ומאפשרת להאיץ את מהירות ההסקה פי 1.5 עד 2. כל זה קורה על אותם משקלים ובלי ירידה באיכות התוצאה.

האם אפשר לעבד תמונות בהרצה מקומית עם llama.cpp?

כרגע לא. כרטיס המודל מציין במפורש שהדגל לתמיכה במולטימודליות אינו נתמך עדיין יחד עם MTP ב־llama.cpp. אם אתם חייבים תמונה, תצטרכו להשתמש בשרתים כמו vLLM או במנוע אחר.

איך מכבים את שלב החשיבה הארוך לפני התשובה?

המודל פועל במצב חשיבה כברירת מחדל, אבל אפשר לבטל אותו על ידי הגדרת הפרמטר enable_thinking לערך שקר בפרמטרי הפנייה. שימו לב שהפקודות הישנות של סלאש think לא נתמכות כאן.

איך מריצים

ההרצה המקומית מתבססת על llama.cpp עם הגדרות ספקולטיביות מתאימות, או דרך Unsloth Studio שקובע את ההגדרות לחומרה שלכם. בגלל גודל המודל, הרצה מלאה של חלון ההקשר המלא דורשת משאבים כבדים מאוד. בשרתים ייעודיים כמו vLLM או SGLang דרושים לרוב 8 מעבדים גרפיים בחיבור מקבילי כדי לנצל את כל 262 אלף הטוקנים.

אם אתם רצים על חומרה מקומית כמו מעבד בודד או כרטיס ביתי, תצטרכו להסתפק בקוונטיזציות נמוכות ולקצץ את חלון ההקשר. במצב כזה, או אם אתם צריכים לשרת עומס משתמשים אמיתי, קריאה ל־API מנוהל תהיה זולה ופשוטה בהרבה מהחזקת הברזלים.

ollama run hf.co/unsloth/Qwen3.6-27B-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הקוד והמשקלים זמינים תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי, הפצה ושילוב במוצרים סגורים בלי תשלום תמלוגים, בכפוף לשמירת הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗