GPT
Q

havenoammo/Qwen3.6-35B-A3B-MTP-GGUF

קוד פתוח

havenoammoapache-2.02026-05-06

  • transformers
  • gguf
  • unsloth
  • qwen
  • qwen3_5_moe

שילוב בין קוונטיזציה דינמית של Unsloth לשכבות חיזוי רב טוקני בדחיסת שמונה ביט. המטרה כאן היא מהירות הפקה גבוהה בהרצה מקומית בלי לאבד דיוק.

  • 144 GBמשקל הקבצים
  • 1,921הורדות בחודש
  • 83לייקים

מה זה

המאגר הזה מציג גרסת GGUF של Qwen3.6-35B-A3B, מודל תערובת מומחים שבו רק שלושה מיליארד פרמטרים פעילים מתוך שלושים וחמישה מיליארד בסך הכל. הייחוד של הקבצים האלה הוא השתלת שכבות Multi-Token Prediction שנלקחו ממאגר אחר ונשמרו ברמת שמונה ביט, ישירות על גבי הקוונטיזציות של Unsloth Dynamic 2.0 XL. הארכיטקטורה משלבת שכבות Gated DeltaNet לצד תשומת לב מסורתית עם מאתיים חמישים ושישה מומחים, שמתוכם שמונה מנותבים ואחד משותף פעילים בכל צעד.

במדדי התכנות והסוכנים, הדגם הבסיסי מציג יתרון מובהק על פני הדור הקודם. במבחן Terminal-Bench 2.0 הוא מגיע לציון 51.5 לעומת 40.5 בגרסה הקודמת, ובמדד NL2Repo הוא מגיע ל־29.4 לעומת 20.5. עם זאת, במבחן SWE-bench Verified התוצאה היא 73.4, שזה שיפור מול 70 של דגם 35B הקודם, אך נמוך במעט מגרסת 27B הצפופה שעמדה על 75.0. שכבות החיזוי המושתלות אמורות לייצר כמה טוקנים בכל מחזור חישוב, וכך לקצר את זמני ההמתנה בעבודה עם קוד מורכב.

מתאים ל

  • סוכני תכנות מורכבים

    המודל קיבל ציון 51.5 בטרמינל בנץ, והוא תומך בשימור הקשר המחשבה בהודעות עוקבות.

  • הסבת שפה למאגרי קוד

    התוצאה במדד NL2Repo מגיעה ל־29.4, שזה שיפור ניכר מול הדור הקודם במשימות רפוזיטורי.

  • פעולות ממשק ודפדפן

    ציון של 1397 ב־QwenWebBench מציב אותו כבחירה חזקה לפירוק דפי רשת ומשימות ווב.

איפה זה נופל

החיסרון המרכזי כאן הוא התלות בתשתית לא רשמית. התמיכה בשכבות החיזוי האלה נשענת על PR פתוח שטרם מוזג לגרסה הרשמית של llama.cpp, מה שאומר שכל עדכון עתידי עלול לשבור תאימות. מעבר לזה, במבחני ידע כללי כמו MMLU-Pro המודל מקבל 85.2, תוצאה כמעט זהה לחלוטין לדור הקודם, ובמבחן VITA-Bench התוצאה שלו צנחה ל־35.6 לעומת 41.8 בדגם 27B.

שאלות
נפוצות

האם אפשר להריץ את הקובץ ישירות בגרסה הרשמית של llama.cpp?

לא. המודל מחייב תמיכה בשכבות MTP שהוטמעו ב־PR 22673 וטרם נכנסו לגרסה הראשית. תצטרכו למזג את הענף ולקמפל בעצמכם, או להוריד את אימג' הדוקר שפרסם היוצר.

למה שכבות החיזוי נשמרו ב־Q8_0 ולא עברו קוונטיזציה מלאה?

ראשי החיזוי קטנים מאוד ביחס לגוף המודל השלם. שמירה שלהם בשמונה ביט שומרת על הדיוק שלהם כמעט ללא הפסד, ומאפשרת להאיץ את קצב הפקת הטוקנים בלי לסרבל את תהליך הדחיסה.

איך מריצים

אי אפשר להריץ את הקבצים האלה עם בינארי סטנדרטי של llama.cpp בלי התאמות. צריך לבנות את llama-server בעצמכם מתוך ענף שכולל את יחסי הציבור 22673, או לחלופין להשתמש באחד מאימג'י הדוקר המוכנים שסופקו עבור סביבות שונות כמו CUDA, Vulkan או ROCm.

בזמן ההפעלה חובה להגדיר את הדגלים spec-type mtp ו־spec-draft-n-max 3 כדי להפעיל את שלושת ראשי החיזוי. נפח האחסון הכולל של הקבצים במאגר מגיע ל־144 ג'יגה בייט בעשרה קבצים שונים, כך שצריך לוודא זיכרון וידאו מספק בהתאם לרמת הקוונטיזציה שנבחרה. אם אין לכם כרטיס מתאים עם תמיכה בהאצה או שאינכם רוצים להתעסק עם קוד לא ממוזג במנוע ההרצה, קריאה לשירות ענן מנוהל תחסוך את כאב הראש.

ollama run hf.co/havenoammo/Qwen3.6-35B-A3B-MTP-GGUF:Q6_K_XL

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. הרישיון מאפשר שימוש מסחרי, שינוי הקוד והפצה חופשית ללא תמלוגים, בתנאי ששומרים על הצהרות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗