GPT
Q

Qwen3.5-0.8B-MTP-GGUF

קוד פתוח

unslothapache-2.02026-05-13

  • transformers
  • gguf
  • unsloth
  • qwen
  • qwen3_5

גרסת GGUF מכווצת של מודל המולטימודל הקטן בסדרה, עם תמיכה מובנית בחיזוי רב שלבי להאצת קצב הפלט. הוא מיועד למי שמחפש מהירות ומשאבים מינימליים במחיר של פגיעה ניכרת ביכולות הסקת המסקנות.

  • 13.2 GBמשקל הקבצים
  • 13,964הורדות בחודש
  • 37לייקים

מה זה

מדובר במודל שפיתחה עליבאבא ועבר המרה לקובצי GGUF על ידי צוות Unsloth. המודל כולל ארכיטקטורה היברידית של Gated DeltaNet ורשתות תשומת לב, יחד עם יכולת עיבוד תמונה וטקסט. המאפיין הבולט כאן הוא אימון MTP, שנועד לאפשר פענוח ספקולטיבי ומאיץ את קצב ייצור הטוקנים בעד פי שניים באמצעות הרחבה ייעודית בתוכנת ההרצה.

מבחינת ביצועים, המספרים בכרטיס ממחישים היטב את הפער של מודל קטן. במבחן MMLU-Pro ללא מצב חשיבה הוא מקבל 29.7 נקודות, וכשמפעילים חשיבה הוא עולה ל־42.3 נקודות בלבד, בעוד דגמים גדולים יותר בסדרה חוצים את ה־60 וה־70. במבחני סוכנים ומעקב אחר הוראות מורכבות התוצאות נשארות נמוכות יחסית, כך שהייעוד המעשי שלו הוא פרוטוטייפים, בדיקות וסיווגים קלים ולא פתרון בעיות עמוק.

מתאים ל

  • בדיקת פרוטוטייפ מקומי

    צריכת הזיכרון הנמוכה ומנגנון החיזוי מאפשרים לבדוק שרשראות קריאה לפונקציות במהירות על מחשב נייד.

  • מיון ראשוני של טקסטים

    מתאים למשימות סיווג בסיסיות שבהן מהירות התגובה ועלות ההרצה קריטיות יותר מהעמקה בניואנסים.

  • אימון נוסף למשימה בודדת

    גודל המודל הופך אותו למועמד נוח וזול לכוונון ייעודי על דאטה מצומצם בעזרת הכלים של Unsloth.

איפה זה נופל

המודל חלש מאוד במשימות מתמטיקה והיגיון מורכב. במבחן PolyMATH הוא מגרד 8.2 נקודות, ובמבחן ההיגיון המדעי GPQA הוא נעצר ב־11.9 נקודות בלבד, כאשר במבחני היגיון כמו HMMT כלל לא פורסמו תוצאות עבורו. גם יכולות מעקב ההוראות נמוכות משמעותית משאר הדגמים בסדרה, עם 44 נקודות בלבד ב־IFEval במצב חשיבה. מעבר לכך, התמיכה בתמונות לצד מנגנון ההאצה עדיין אינה שלמה בתוכנת ההרצה.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לעיבוד תמונות דרך llama.cpp?

המודל כולל רכיב ראייה לפי המפרט, אך כרטיס המודל מציין מפורשות שהרכיב החזותי אינו נתמך כרגע יחד עם מנגנון ה־MTP בתוכנת ההרצה. אם מטרת הריצה היא ניתוח תמונה מקומי תוך ניצול ההאצה, זה לא יעבוד באופן חלק כרגע.

מה נותן מנגנון ה־MTP בפועל בהרצה יומיומית?

הוא מאפשר לתוכנת ההרצה לבצע פענוח ספקולטיבי ולחזות כמה טוקנים קדימה בלי להזדקק למודל טיוטה חיצוני. לפי התיעוד הדבר מניב מהירות כפולה בריצה, אך מחייב שימוש בפרמטר draft-mtp ובגרסה תואמת של המערכת.

איך מריצים

ההרצה המקומית מתבססת על llama.cpp מקומפל עם תמיכה בדגל draft-mtp כדי לקבל את תוספת המהירות. הקבצים שוקלים בסך הכול 13.2 גיגה בייט ומחולקים ל־27 קבצים שונים, כך שאפשר להריץ אותם בקלות על חומרת צרכנים, כולל מעבד רגיל או מעבדי אפל באמצעות כיבוי מאיצי שרת, לצד אפשרות להאצה מלאה על כרטיס גרפי פשוט.

בכרטיס מצוין מפורשות שפיצ'ר ה־MTP עדיין לא תומך בריבוי תהליכים במקביל או במודול התמונות הנפרד, ולכן הרצה של יכולות חזותיות במקביל לחיזוי המואץ מוגבלת כרגע. אם אתם צריכים לנתח תמונות באופן אמין או לענות לפניות רבות בו זמנית, שימוש ב־API מרוחק של מודל גדול יחסוך את כאב הראש.

ollama run hf.co/unsloth/Qwen3.5-0.8B-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0 פתוח ומאפשר שימוש מסחרי, שינוי קוד והפצה של המודל בתוך מוצרים. התנאי המרכזי הוא שמירה על זכויות היוצרים וצירוף עותק מהרישיון המקורי, ללא אחריות מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗