GPT
Q

Qwen3.5-9B-MTP-GGUF

קוד פתוח

unslothapache-2.02026-05-13

  • transformers
  • gguf
  • unsloth
  • qwen
  • qwen3_5

מודל משולב טקסט ותמונה בגודל תשעה מיליארד פרמטרים שרץ מהר במיוחד. הוא משתמש בפיענוח ספקולטיבי מובנה כדי לחסוך זמני תגובה בריצה מקומית.

  • 139 GBמשקל הקבצים
  • 76,660הורדות בחודש
  • 186לייקים

מה זה

הגרסה הזו מביאה ארכיטקטורה היברידית של שכבות תשומת לב ליניאריות לצד שכבות רגילות, יחד עם יכולת עיבוד מולטימודלית מהבסיס. הדגש העיקרי כאן הוא תמיכה בפיענוח ספקולטיבי מסוג MTP, שמאפשר למודל לייצר מספר טוקנים קדימה בכל צעד חישוב ולהאיץ את קצב הפליטה פי אחד וחצי עד פי שניים בהשוואה להרצה רגילה.

במדדי ההערכה של שפת תכנות והיגיון, המודל מגיע לתוצאה של 65.6 בבחינת LiveCodeBench וציון של 81.7 בבחינת GPQA Diamond. בבדיקות של הפעלת כלים וסוכנים הוא מקבל 66.1 במדד BFCL, מה שמציב אותו בעמדה תחרותית מאוד ביחס למודלים בקטגוריית הגודל שלו, תוך תמיכה מוצהרת במעל מאתיים שפות.

מתאים ל

  • עוזרי פיתוח מקומיים

    תמיכה מובנית בהגדרת תפקיד מפתח והאצת קצב הטקסט מתאימות לכתיבת קוד במחשב מקומי.

  • מערכות הפעלת כלים

    שיפור ביכולת פענוח מבני נתונים מקוננים מסייע בדיוק קריאות לפונקציות ואינטגרציות.

  • שרתי שיחה מהירים

    מנגנון הניחוש הספקולטיבי מוריד את זמני ההמתנה של משתמשים בשיחות טקסט רגילות.

איפה זה נופל

החיסרון המרכזי בפורמט הזה הוא חוסר הבשלות של התוכנה המריצה. הכרטיס מודה במפורש שפיענוח MTP אינו נתמך יחד עם מעבד התמונה, כך שנכון לעכשיו אתם נאלצים לבחור בין מהירות הפקת טקסט גבוהה לבין היכולת להזין תמונות. בנוסף, משימות תכנון מורכבות חושפות מגבלה קשה, עם ציון נמוך של שמונה עשר אחוזים בלבד במבחן DeepPlanning.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לניתוח תמונות במהירות כפולה?

לא בשלב זה. הכרטיס מציין שתמיכת MTP אינה עובדת עם רכיב הראייה של המודל בתוכנת ההרצה, ולכן היתרון במהירות תקף לטקסט בלבד.

כמה זיכרון וידאו נחוץ כדי להריץ את גרסת הבלוקים הנפוצה?

עבור קובץ בקוונטיזציה של ארבעה ביטים עם חלון הקשר של שמונה אלפים טוקנים, כרטיס מסך עם שתים עשרה עד שש עשרה גיגה בייט יספיק לטעינה מלאה.

איך מריצים

כדי להפעיל אותו עם ההאצה המובנית צריך לבנות את llama.cpp מגרסה עדכנית עם תמיכה בטיוטת MTP. בהרצה דרך llama-server מעבירים את הדגל draft-mtp ומגדירים את עומק הניחוש קדימה, למשל עד שישה טוקנים. הרצה מלאה על כרטיס מסך בקוונטיזציה של ארבעה ביטים דורשת זיכרון וידאו טיפוסי של כרטיס מודרני בודד, סביב שתים עשרה עד שש עשרה גיגה בייט.

המפרסם מציין כי כרגע פיצ'ר הפיענוח המהיר לא עובד במקביל לפקודת mmproj לעיבוד תמונה, וגם לא בתצורת הרצה מרובת תהליכים. אם אתם צריכים לנתח תמונות ברצף או לשרת עשרות משתמשים במקביל באותו שרת, עדיף לפנות לנקודת קצה מנוהלת במקום להסתבך עם המגבלות של ההרצה המקומית הזו.

ollama run hf.co/unsloth/Qwen3.5-9B-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש במודל לצרכים מסחריים, לשלב אותו בתוכנה סגורה, לשנות אותו ולהפיץ אותו בחופשיות. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗