GPT
Q

Qwen3.6-35B-A3B-MTP-GGUF

קוד פתוח

unslothapache-2.02026-05-11

  • transformers
  • gguf
  • unsloth
  • qwen
  • qwen3_5_moe

שילוב של ארכיטקטורת תערובת מומחים עם חיזוי מרובה של טוקנים, שמאפשר להריץ מודל עם יכולות קוד חזקות במהירות כפולה ובמחיר חישובי של שלושה מיליארד פרמטרים בלבד.

  • 495 GBמשקל הקבצים
  • 745,823הורדות בחודש
  • 910לייקים

מה זה

הארכיטקטורה כאן מחזיקה שלושים וחמישה מיליארד פרמטרים בסך הכול, אבל מפעילה רק שלושה מיליארד בכל שלב. הדבר הזה מוריד את העומס החישובי לרמה של מודל קטן, בזמן שהידע השמור והדיוק נשארים של מודל בינוני. ההבדל הגדול בגרסה הזו הוא מנגנון החיזוי מרובה הטוקנים שמייצר האצה של פי אחד וחצי עד פי שניים בריצה, בלי לפגוע בתוצאות.

במבחני ביצועים לקוד הוא מוביל בפער על פני גרסאות קודמות. בבדיקות של סוכני פיתוח כמו SWE-bench Verified הוא מגיע לציון 73.4, לעומת 70 במודל הקודם מסדרת 3.5, ובמשימות פרונטנד וניתוח ריפוזיטורי שלם ב־QwenWebBench הוא קופץ ל־1397 נקודות. במבחני ידע כללי כמו MMLU ההבדלים בינו לבין קודמיו זניחים, כך שעיקר השדרוג מתרכז בעבודה אוטונומית מול קבצי קוד והפעלת כלים חיצוניים.

מתאים ל

  • סוכן כתיבת קוד מקומי

    אידיאלי לעבודה בתוך סביבות פיתוח מול מאגרי קוד מלאים, בזכות מהירות תגובה גבוהה ותוצאות טובות במבחני SWE-bench.

  • הפעלת כלים וקריאות פונקציה

    מתאים לצינורות עבודה מורכבים בזכות שיפור ייעודי בפענוח אובייקטים מקוננים והתאמה לפרוטוקול MCP.

  • פיתוח ממשקי משתמש ופרונטנד

    מיועד למשימות ווב ופרונטנד שדורשות הקשר ארוך והבנה של קבצי תצוגה מרובים, תחום שבו נרשם זינוק בבנצ'מרק.

איפה זה נופל

למרות ההתקדמות בסוכני קוד, יש למודל מגבלות טכניות מורגשות כרגע במימוש הקיים. כרטיס המודל מבהיר שבזמן שימוש במנגנון MTP אין תמיכה בריצה במקביל לכמה בקשות בו זמנית, ואין תמיכה בחיבור רכיבי ראייה דרך llama.cpp. בנוסף, במבחני תכנון עמוק ופתרון בעיות קצה מורכבות כמו HLE הציון עומד על 21.4 בלבד, ובבדיקות מסוימות של סוכנים כלליים כמו VITA-Bench נרשמה ירידה מול הדור הקודם. לא הייתי בונה עליו להחלטות לוגיות מורכבות מחוץ לעולם התוכנה.

שאלות
נפוצות

האם המודל יכול לנתח תמונות בריצה מקומית?

הבסיס כולל אנקודר לראייה, אך כרגע כרטיס המודל מציין מפורשות שבריצה עם מנגנון MTP ב־llama.cpp אין תמיכה בקובצי הפרויקציה של התמונה. אם המטרה היא ניתוח ויזואלי מקומי, תצטרכו להריץ אותו ללא MTP או להמתין לעדכון תוכנה.

כמה זיכרון צריך בפועל כדי להריץ אותו?

למרות שרק שלושה מיליארד פרמטרים פעילים בכל חישוב, כל שלושים וחמישה המיליארד צריכים להיטען לזיכרון. בגרסת כיול טיפוסית של ארבעה ביט תצטרכו לפחות עשרים עד עשרים וארבעה גיגה־בייט של זיכרון גרפי פנוי, עוד לפני שמחשבים את זיכרון ההקשר.

איך מריצים

את המשקלים בפורמט GGUF מריצים ישירות דרך llama-server עם דגלים ספציפיים ל־MTP, או באמצעות Unsloth Studio שמגדיר את הפרמטרים לבד. הארכיטקטורה דורשת פחות כוח עיבוד בזמן ריצה בגלל מיעוט הפרמטרים הפעילים, אבל כל שלושים וחמישה המיליארד חייבים לשבת בזיכרון. זה אומר שאי אפשר להתחמק מדרישת זיכרון וידאו של כרטיס מקצועי או זיכרון מאוחד גדול במק כדי להחזיק את הקבצים המכווצים.

אם אין לכם כרטיס עם מספיק זיכרון להחזיק את כל המשקלים, עדיף להשתמש ב־API חיצוני. פיצול זיכרון ל־CPU במודל כזה יבטל לגמרי את יתרון המהירות של מנגנון החיזוי.

ollama run hf.co/unsloth/Qwen3.6-35B-A3B-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המשקלים והפצה בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗