GPT
N

Nail-Qwen3.6-35B-A3B-GGUF-MTP

קוד פתוח

peculiar-ragdollapache-2.02026-08-11

  • gguf
  • llama.cpp
  • qwen3_6
  • moe
  • mtp

גרסת GGUF מהירה של Qwen3.6-35B-A3B שכוללת שכבות חיזוי רב טוקני ומכוונת לתשובות קצרות וחדות. היא מתאימה למי שצריך תפוקה גבוהה במשימות קוד וסוכנים בלי מריחות וברבורים.

  • 245 GBמשקל הקבצים
  • 20,196הורדות בחודש
  • 60לייקים

מה זה

מדובר באריזה של המודל מבוסס המומחים Qwen3.6-35B-A3B עם 3.4 מיליארד פרמטרים פעילים, שמגיעה עם קוונטיזציה דינמית של Unsloth. הייחוד בקובץ הזה הוא שמירת שכבות ה־MTP לטובת speculative decoding, יחד עם תבנית שיחה קבועה שכופה הנחיית מערכת אגרסיבית לתשובות קצרות, ישירות וללא הקדמות מיותרות.

במבחני ביצועים שנערכו במקור על גרסת MLX, המבנה הזה פתר בעיות תכנות ב־SWE Live מהר פי שניים עד חמישה ממודלים דחוסים מקבילים בגודל 27B, תוך שמירה על רמת דיוק זהה לחלוטין. הוא תוכנן לחתוך זמני חשיבה מיותרים, למנוע לולאות תקועות בקריאות לכלים, ולהפיק פתרון עובד במינימום שניות שעון.

מתאים ל

  • סוכן תכנות אוטונומי

    מייצר פתרונות מהירים לקוד ומבצע קריאות לכלים בלי הקדמות ובלי להיתקע בלולאות מיותרות.

  • פתרון משימות קצרות ומרובות

    מנצל ארכיטקטורת MoE ופיענוח MTP לסגירת שאילתות עצמאיות בזמן קצר משמעותית ממודלים דחוסים.

  • הרצה מקומית על כרטיס 24GB

    מאפשר עבודה עם הקשר של 180 אלף טוקנים בקוונט IQ4_XS על חומרת צרכנים ביתית בודדת.

איפה זה נופל

המדדים בכרטיס נמדדו על גרסת MLX ולא על קובץ ה־GGUF הזה, כך שביצועי הריצה בפועל תלויים במימוש ב־llama.cpp. בנוסף, הנחיית התמציתיות צרובה ישירות בתבנית השיחה של הקובץ ואי אפשר לבטל אותה דרך ה־API אלא בעריכת הקובץ עצמו.

החיסרון התפעולי הבולט ביותר הוא צריכת הקונטקסט. המודל שורף 5,777 טוקנים לשאלה במבחני חשיבה לעומת 2,380 טוקנים במודלים מתחרים, ולכן בשיחות סוכן ארוכות מאוד שנשארות בתוך אותו חלון זיכרון הוא ממלא את ההקשר מהר מדי.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך הרשימה?

אם יש לכם כרטיס של 24 גיגה בייט, הבחירה המאוזנת ביותר היא גרסת IQ4_XS שתופסת 18.2 גיגה בייט ומשאירה מקום נוח לזיכרון הקשר ותצוגה. אם הזיכרון מוגבל ל־16 גיגה בייט, תצטרכו לרדת לגרסת IQ3_XXS שתופסת 14.1 גיגה בייט.

האם אפשר להשתמש במודל הזה לשיחות סוכן ארוכות של עשרות שלבים?

הוא פחות מתאים לזה. למרות שחלון ההקשר המקסימלי עומד על 262 אלף טוקנים, תהליך החשיבה שלו מייצר המון טוקנים פנימיים ששורפים את המקום בקונטקסט פי שניים וחצי מהר יותר מחלופות מקבילות.

האם המודל תומך בניתוח תמונות?

כן, המודל מוגדר למשימות טקסט ותמונה יחד. כדי להפעיל עיבוד תמונה ב־llama.cpp צריך להשתמש בפקודת llama-mtmd-cli ולוודא שמורידים לצד המודל גם את קובץ mmproj-F16.gguf.

איך מריצים

ההרצה נעשית דרך llama.cpp מגרסת מקור עדכנית התומכת בדגל spec-type draft-mtp כדי לנצל את האצת ה־MTP, לצד קובץ ה־mmproj אם רוצים יכולות ראייה. הקבצים נעים מ־14.1 גיגה בייט בגרסת IQ3_XXS ועד כ־71 גיגה בייט בגרסת BF16 המלאה בשני חלקים.

כרטיס בודד של 24 גיגה בייט כמו RTX 4090 מחזיק מצוין את גרסת IQ4_XS בנפח 18.2 גיגה בייט יחד עם קונטקסט נדיב של 180 אלף טוקנים ב־KV של 8 ביט. למי שמחזיק כרטיס של 16 גיגה בייט עדיף לקחת את גרסת ה־IQ3 המצומצמת, ובמקרים של עומסים כבדים ללא חומרה מקומית מתאימה עדיף לפנות ל־API ייעודי.

ollama run hf.co/peculiar-ragdoll/Nail-Qwen3.6-35B-A3B-GGUF-MTP:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0 מלא. אתם רשאים להריץ אותו, לשנות אותו, להטמיע אותו במוצרים מסחריים סגורים ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗