GPT
Q

Qwen3.5-2B-MTP-GGUF

קוד פתוח

unslothapache-2.02026-05-13

  • transformers
  • gguf
  • unsloth
  • qwen
  • qwen3_5

גרסת GGUF של מודל מולטימודלי קטן עם ארכיטקטורת חיזוי רב שלבי. הוא מתאים למי שרוצה הסקת מסקנות מהירה מקומית על טקסט ותמונה בחומרה צנועה.

  • 32.6 GBמשקל הקבצים
  • 21,804הורדות בחודש
  • 41לייקים

מה זה

מדובר במודל שפה ותמונה עם שני מיליארד פרמטרים, המבוסס על שילוב של שכבות Gated DeltaNet ורשתות תשומת לב, יחד עם מנגנון MTP לחיזוי מספר טוקנים קדימה. המבנה ההיברידי הזה מאפשר לו לעבד הקשר ארוך של עד 262,144 טוקנים, תוך שמירה על מהירות גבוהה. השינוי המרכזי כאן לעומת דגמים קודמים בסדרה הוא תמיכה בחיזוי ספקולטיבי מובנה, שמאיץ את קצב הפקת הטקסט כמעט פי שניים.

במבחני ביצועים, המודל מציג פער ברור על פני דגמי 1.7B ישנים ודגם 0.8B המקביל, אך עדיין נמצא מאחורי גרסת ה־4B במשימות חשיבה מורכבות. במבחן SuperGPQA במצב חשיבה הוא מקבל ציון 37.5 לעומת 47.8 בגרסת 4B, ובמבחן הנימוק המתמטי HMMT הוא משיג 22.9 מול 57.5. עם זאת, במבחני סוכנים וקריאות לכלים כמו TAU2-Bench ו־BFCL-V4 הוא רושם 48.8 ו־43.6 בהתאמה, תוצאות שמציבות אותו מעל גרסאות קודמות בגודל מקביל.

מתאים ל

  • סוכן מקומי לקריאות כלים

    כולל תמיכה באובייקטים מקוננים ושיפורים לקריאה לפונקציות בציון 43.6 במבחן BFCL-V4.

  • הסקה מהירה במכשיר קצה

    חיזוי ספקולטיבי מאיץ את הפקת הטקסט פי 1.5 עד 2 על גבי מעבדים או כרטיסי מסך קטנים.

  • פרוטוטייפינג ועיבוד הקשר

    חלון הקשר גדול מאוד של 262,144 טוקנים בתוך מודל של שני מיליארד פרמטרים.

איפה זה נופל

למרות השילוב של מנגנון ראייה, כרטיס המודל מציין במפורש שהרחבת המולטימודל mmproj אינה נתמכת כרגע יחד עם MTP ב־llama.cpp. בנוסף, חל איסור להשתמש בערך np גדול מ־1 בריצה המקומית, מה שמגביל מאוד תרחישי שרת תובעניים. מבחינת יכולות, המודל מתקשה בחשיבה מתמטית עמוקה, ובמבחן ההיגיון HMMT הוא רושם ציונים נמוכים של כ־20 אחוזים, כך שלא הייתי משתמש בו למשימות מדעיות או חישובים מדויקים.

שאלות
נפוצות

האם אפשר להשתמש ביכולות התמונה יחד עם האצת MTP?

לא כרגע. לפי כרטיס המודל, השימוש בדגל mmproj שמיועד לעיבוד תמונה אינו נתמך עדיין יחד עם MTP ב־llama.cpp.

מה דרוש כדי ליהנות מההאצה של Speculative Decoding?

יש לקמפל את llama.cpp מגרסה שכוללת את השינויים שנכנסו במאי 2026, ולהפעיל את השרת עם הפרמטר draft-mtp.

האם המודל מתאים למשימות מתמטיקה ולוגיקה מורכבות?

לא. במבחני חשיבה כמו HMMT הוא משיג ציונים סביב 19 עד 23, רחוק מדגמי 4B או מודלים גדולים יותר.

איך מריצים

כדי להריץ אותו צריך לקמפל גרסה עדכנית של llama.cpp שתומכת ב־MTP speculative decoding. הפעלת השרת נעשית עם הדגלים draft-mtp וציון spec-draft-n-max עד 6, כשהמשקלים מחולקים לקובצי GGUF עם כיול דינמי. המודל שוקל מעט מאוד בזיכרון, ולכן כרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון וידאו יספיק לטעינת כל השכבות. מי שאין לו כרטיס גרפי ייעודי יכול להריץ אותו על המעבד ישירות.

אם אתם צריכים לשרת אלפי משתמשים במקביל או תלויים ב־batching רחב, כדאי לשים לב שמנגנון ה־MTP ב־llama.cpp אינו תומך כרגע בהרצה מרובת מקביליות np מעל 1. במצב כזה, עדיף להריץ אותו דרך vLLM או SGLang, או להשתמש ב־API חיצוני של שירות ענן.

ollama run hf.co/unsloth/Qwen3.5-2B-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה מחדש בתוך מוצרים סגורים. התנאי המרכזי הוא שמירה על הצהרת זכויות היוצרים והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗