GPT
Q

Qwen3.5-4B-MTP-GGUF

קוד פתוח

unslothapache-2.02026-05-13

  • transformers
  • gguf
  • unsloth
  • qwen
  • qwen3_5

גרסת GGUF למודל מולטימודלי קומפקטי שמביא יכולות ראייה וטקסט. הוא מתאים למי שרוצה להריץ סוכן מקומי במהירות גבוהה בזכות תמיכה בייצור ספקולטיבי מסוג MTP.

  • 67.3 GBמשקל הקבצים
  • 92,677הורדות בחודש
  • 86לייקים

מה זה

מדובר במודל שמשלב טקסט ותמונה בארכיטקטורת 4B פרמטרים, המבוססת על שילוב של Gated Delta Networks ורשתות קשב רגילות. המבנה הזה נועד לאפשר ריצה מהירה ויעילה בצריכת הזיכרון. המודל מציע חלון הקשר עצום שמתחיל ב־262,144 טוקנים ומסוגל להתרחב מעבר לכך, לצד יכולת מובנית לפענוח ספקולטיבי שמאיצה את פליטת הטוקנים פי 1.5 עד 2.

במבחני ביצועים, הדגם מציג תוצאות מפתיעות לגודלו. במדד הסוכנים TAU2-Bench הוא עומד על 79.9, ציון שעוקף אפילו את גרסת ה־9B של אותה סדרה, ובמדד IFEval להבנת הוראות הוא מגיע ל־89.8. עם זאת, במבחני תכנות מורכבים כמו LiveCodeBench v6 הוא מסתפק ב־55.8 וב־OJBench רק ב־24.1, מה שממחיש שהוא מיועד להבנה שוטפת, קריאת מסמכים ותפעול כלים, ולא לכתיבת אלגוריתמים מסובכים מאפס.

מתאים ל

  • הפעלת סוכנים אוטונומיים

    התוצאה החזקה במדדי TAU2-Bench ו־IFEval מתאימה לקריאת כלים ולמעקב אחרי הוראות מורכבות במשאבים נמוכים.

  • ניתוח מסמכים ואורכים כבדים

    חלון הקשר מקורי של מעל 260 אלף טוקנים מאפשר לסרוק טקסטים ארוכים במחשב מקומי בלי לחתוך מידע.

  • מערכות דיאלוג מקומיות

    שילוב של מודל קטן עם פענוח MTP מספק קצב פליטת טוקנים גבוה שמתאים לצ'אטים אינטראקטיביים.

איפה זה נופל

החולשה העיקרית היא יכולת התכנות והפתרון האלגוריתמי, כפי שמשתקף בבירור בציונים הנמוכים במבחני קוד. בנוסף, מימוש ה־MTP ב־llama.cpp כולל מגבלות טכניות מפורשות. לא ניתן לעבוד במקביל עם יותר ממופע אחד, והתמיכה בפרויקטור התמונה אינה פועלת עדיין יחד עם דגל ה־MTP. המשמעות היא שאם אתם חייבים פענוח ספקולטיבי מואץ עבור קלטי תמונה, הכלי ידרוש בדיקה והתאמות.

שאלות
נפוצות

האם אפשר להשתמש בהאצת MTP עבור קלטי תמונה?

לפי תיעוד הפרויקט, הדגל mmproj שמטפל ברכיב הראייה אינו נתמך עדיין יחד עם מנגנון ה־MTP ב־llama.cpp. תצטרכו לבחור בין פענוח ספקולטיבי בטקסט בלבד לבין הרצת יכולות המולטימודל בקצב רגיל.

האם המודל מתאים לחילוץ נתונים מובנים של כלי מערכת?

כן, המפרסמים מציינים שיפור ייעודי בפענוח אובייקטים מקוננים לטובת קריאות לפונקציות. יחד עם תמיכה בתפקיד מפתח, הוא עובד היטב מול סביבות פיתוח וסוכנים.

איך מריצים

כדי להריץ אותו עם פענוח MTP מהיר, מקמפלים גרסה עדכנית של llama.cpp עם תמיכה ב־CUDA או ללא האצה עבור מעבדי CPU ו־Metal. הפקודה מריצה את llama-server מול קובץ ה־GGUF הרצוי, למשל קוונטיזציה של UD-Q4_K_XL, יחד עם הדגלים spec-type draft-mtp וקביעת מספר טוקנים לטיוטה.

משקל הקבצים הכולל במאגר מגיע ל־67.3 גיגה־בייט בגלל ריבוי גרסאות הקוונטיזציה, אך קובץ בודד של מודל 4B דורש זיכרון VRAM צנוע שיכול להיכנס בקלות לכרטיס מסך ביתי בודד. אם אתם זקוקים למקביליות גבוהה של פניות בו־זמנית, קחו בחשבון שהרצה כזו תדרוש שירות API מנוהל.

ollama run hf.co/unsloth/Qwen3.5-4B-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים, והפצה מחדש כחלק ממוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗