GPT
Q

byteshape/Qwen3.6-35B-A3B-MTP-GGUF

קוד פתוח

byteshapeapache-2.02026-05-19

  • transformers
  • gguf
  • qwen3.6
  • byteshape
  • mtp

גרסה מכווצת של מודל ראייה ושפה 35B שמכילה מנגנון חיזוי מרובה טוקנים מובנה. היא נועדה להאיץ מהירויות פענוח ישירות על גבי כרטיסי מסך בלי צורך במודל טיוטה חיצוני.

  • 71.2 GBמשקל הקבצים
  • 6,000הורדות בחודש
  • 86לייקים

מה זה

מדובר במודל ראייה וטקסט בנפח 35 מיליארד פרמטרים, שקוונטט לפורמט GGUF בעזרת שיטה שמתאימה ייצוג שונה לכל טנזור. הייחוד כאן הוא ראש חיזוי מרובה טוקנים מובנה בקובץ עצמו. במקום לייצר טוקן בודד בכל מעבר, המודל חוזה כמה טוקנים קדימה בבת אחת ובודק אותם מול עצמו, מה שמקצר את זמני הריצה באופן ניכר בלי לתחזק שרת נוסף למודל קל.

המודל כולל יכולות עיבוד תמונה וטקסט, ותומך בהפעלת פונקציות. המפתחים בחנו את הגרסאות השונות במדדים כמו LiveCodeBench, HumanEval ו־IFEVAL, במצבי הנחיה וחשיבה. המספרים מראים שהמנגנון מעלה את קצב הטוקנים האפקטיבי בעיקר כשהפלט צפוי וברור, אך הוא שומר על איכות התוצאות ביחס לריצה רגילה.

מתאים ל

  • השלמת קוד מקומית

    מבנה קוד צפוי מאפשר למנגנון הניבוי לקבל כמה טוקנים בבת אחת ולקצר זמני תגובה בעבודה שוטפת.

  • חילוץ מידע מתמונות

    רכיב הראייה המובנה קורא מסמכים ותמונות ומייצר פלט מובנה במהירות גבוהה על גבי GPU.

  • הפעלת פונקציות ברצף

    שילוב יכולת התכנות והתחביר המובנה מאפשר הרצת סוכנים ואוטומציות שדורשות מהירות גבוהה.

איפה זה נופל

האצת החיזוי תלויה לחלוטין באופי המשימה. קוד ומבני נתונים קבועים כמו JSON מקבלים האצה טובה, אבל בכתיבה יצירתית או בטקסטים פחות צפויים המודל דוחה את הטוקנים המשוערים והיתרון נעלם כמעט לגמרי. בנוסף, חובה להשתמש בבילד חדש מאוד של המנוע ולוודא שהחומרה תומכת בריצה מלאה על הזיכרון הגרפי, אחרת הביצועים ייפגעו קשות.

שאלות
נפוצות

איזה ערך מומלץ להגדיר עבור מספר הטוקנים לחיזוי?

הבדיקות מראות שחיזוי של שניים עד ארבעה טוקנים נותן את היחס הטוב ביותר בין מהירות לדיוק. שווה לבדוק את זה ידנית על הדאטה שלכם, כי במסמכים חזרתיים אפשר לקבל קצב גבוה יותר מאשר בטקסט חופשי.

האם צריך להוריד מודל טיוטה נפרד לספקולציה?

אין צורך להוריד שום קובץ נוסף. הראש של מנגנון החיזוי ארוז כבר בתוך קובץ ה־GGUF עצמו, ושרת ההרצה מפעיל אותו ישירות דרך הגדרת הדגל המתאים.

איך מריצים

כדי להריץ אותו צריך llama.cpp מעודכן שמכיר את הדגל draft-mtp, ומריצים פקודת llama-server שמורידה לבד את המודל ואת רכיב הראייה. כל הגרסאות נבנו לריצה על GPU בלבד, ולכן אין טעם לנסות לפרוס אותן על מעבד רגיל. גודל הקבצים נע בין 10 ג'יגה־בייט בגרסת 2.25 ביט ועד 18.6 ג'יגה־בייט בגרסת 4.19 ביט, כך שכרטיס כמו RTX 4090 או כרטיסים חזקים יותר יחזיקו את המשקלים הגדולים בזיכרון בלי בעיה.

אם יש לכם כרטיסי מסך חלשים יותר, או שאתם צריכים רק קריאות ספורדיות בלי להחזיק שרת דלוק, עדיף לפנות ל־API מסחרי. החומרה הנדרשת מחייבת שרת GPU ייעודי שעלותו גבוהה אם הוא עומד ללא שימוש.

ollama run hf.co/byteshape/Qwen3.6-35B-A3B-MTP-GGUF:IQ3_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקבצים ולשלב אותם בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון השינויים שבוצעו בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗