GPT
Q

Qwen3.8-27B-MTP-GGUF

קוד פתוח

Jackrongapache-2.02026-08-15

  • transformers
  • gguf
  • llama.cpp
  • image-text-to-text
  • vision

גרסת GGUF של מודל ראייה ושפה עם 27 מיליארד פרמטרים שכוללת רכיב חיזוי מובנה. היא מכפילה את קצב יצירת הטקסט בלי שתצטרכו להחזיק מודל עזר נפרד בזיכרון.

  • 229 GBמשקל הקבצים
  • 49,561הורדות בחודש
  • 49לייקים

מה זה

המודל משלב יכולות עיבוד תמונה וטקסט עם ארכיטקטורת ניבוי מרובה טוקנים ישירות בתוך הקובץ. במקום להריץ מודל טיוטה קטן כדי להאיץ את הפעולה, מנגנון הניבוי יושב בפנים וחוסך את כל התקורה של סנכרון שני מודלים שונים במקביל.

במבחני ביצועים פנימיים הוא מגיע לקצב של 24.05 טוקנים לשנייה לעומת 12.09 בגרסת GGUF רגילה, ומוריד את זמן ההמתנה לבקשה מ־13.33 שניות ל־7.11 שניות. במבחני קוד כמו SWE-bench Pro הוא קיבל 61.7 לעומת 53.5 בדור הקודם, ובמבחן המשימות המורכבות DeepSWE 1.1 הוא קופץ ל־42.2 מול 13.3 בלבד.

מתאים ל

  • פיתוח סוכני קוד מקומיים

    תוצאה של 73.0 במבחן Terminal Bench מאפשרת הרצת משימות פיתוח מרובות שלבים במסוף.

  • ניתוח מסמכים ותרשימים

    עיבוד תמונה מובנה בקצב של 22.15 טוקנים לשנייה בלי לפגוע בזמני התגובה.

  • אוטומציה של משימות משרדיות

    הציון 70.7 ב־CoWorkBench מתאים לטיפול ארוך טווח בנהלים ועיבוד נתונים מורכב.

איפה זה נופל

במשימות חשיבה רב-תחומיות מורכבות במבחן HLE הוא משיג ציון נמוך של 30.8, נמוך משמעותית מביצועי מודלי קצה סגורים. בנוסף, במבחן הקוד הקיצוני Agents Last Exam שיעור ההצלחה שלו בניסיון ראשון עומד על 20.4 בלבד. קחו בחשבון שקצב הטוקנים הגבוה נבדק בתנאי מעבדה עם Flash Attention והוא תלוי ישירות באורך הקלט ובעומק החשיבה שתגדירו.

שאלות
נפוצות

האם חייבים להריץ מודל טיוטה קטן במקביל כדי לקבל את המהירות הזו?

לא. שכבת הניבוי מאומנת כבר בתוך המשקלים עצמם, ולכן המודל מבצע speculative decoding בלי לטעון קובץ נוסף לכרטיס המסך.

איך מכוונים את עומק פתרון הבעיות בריצה?

מצב החשיבה מופעל כברירת מחדל, וניתן לכבות אותו לפי בקשה. אפשר לשלוט ברמת ההעמקה עם הפרמטר reasoning_effort ולשמור את רצף המחשבה בהיסטוריה דרך preserve_thinking.

איך מריצים

הרצה מקומית ב־llama.cpp דורשת להגדיר את הדגלים spec-type draft-mtp ו־spec-draft-n-max 2 כדי להפעיל את מנגנון ההאצה. נפח הקבצים הכולל במאגר מגיע ל־229 ג׳יגה בייט על פני 15 קבצים, כך שתצטרכו כרטיסי מסך חזקים עם זיכרון משמעותי כדי להחזיק את המודל ואת הקשר הטקסט הארוך.

אם אין לכם שרת ייעודי עם חומרה ברמה הזו, סביר יותר לחכות לשירות הענן הרשמי שהוכרז, שם המודל יגיע עם חלון של מיליון טוקנים מנוהל וללא צורך לתחזק שרתים מקומיים יקרים.

ollama run hf.co/Jackrong/Qwen3.8-27B-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה חופשית. אתם יכולים לשלב אותו במוצרים שלכם בלי תשלום תמלוגים, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗