GPT
Q

Qwen3.5-122B-A10B-MTP-GGUF

קוד פתוח

unslothapache-2.02026-05-15

  • transformers
  • gguf
  • unsloth
  • qwen
  • qwen3_5_moe

ארכיטקטורת תערובת מומחים שמפעילה עשרה מיליארד פרמטרים מתוך מאה עשרים ושניים, עם תמיכה בהאצת יצירה וראייה מובנית. מתאים למי שרוצה ביצועים של מודל ענק בלי לשלם בזמן תגובה.

  • 1.7 TBמשקל הקבצים
  • 26,424הורדות בחודש
  • 103לייקים

מה זה

מדובר במודל מולטימודלי המשלב טקסט ותמונה בארכיטקטורת תערובת מומחים היברידית, המשלבת שכבות של רשתות דלתא עם שכבות קשב. המבנה הזה כולל מאתיים חמישים ושישה מומחים שמהם שמונה מנותבים ואחד משותף פעילים בכל צעד. התוצאה היא מודל שמחזיק נפח ידע של מאה עשרים ושניים מיליארד פרמטרים, אבל מבצע חישוב של עשרה מיליארד בלבד בכל טוקן, לצד תמיכה מובנית בריבוי צעדי חיזוי לזירוז הפלט.

במדדי הביצועים הוא מציג תוצאות גבוהות במיוחד ביחס למתחרים סגורים ופתוחים. במבחן SuperGPQA הוא מגיע לציון 67.1 ועוקף את המתחרים המובילים בטבלה, ובמבחן ההיגיון המורכב HLE w/ CoT הוא מגיע לתוצאה של 25.3, לעומת 19.4 של חלופות מסחריות קטנות. גם במשימות תכנות מעשיות כמו Terminal Bench 2 הוא משיג 49.4, שזה פער ברור על פני מודלים מקבילים.

מתאים ל

  • פתרון בעיות היגיון מורכבות

    משיג ציון 86.6 במבחן GPQA Diamond ומאפשר פירוק בעיות מדעיות תוך שימוש במנגנון חשיבה מובנה.

  • אוטומציה בסביבת פיתוח וקוד

    מציג ציון של 49.4 בטרמינל בנץ ותמיכה מובנית בתפקיד מפתח להשתלבות בכלים כמו קודקס.

  • קריאת פונקציות מורכבות

    כולל תבנית שיחה משופרת שמטפלת במבני נתונים מקוננים של כלי מערכת באופן מדויק.

איפה זה נופל

הטמעה של המודל בתהליך עבודה קיימת נתקלת כרגע במגבלות טכניות קשיחות. הכרטיס מציין במפורש שהרצת חיזוי הטיוטה המהיר אינה תומכת עדיין בעיבוד מקבילי מעבר לתהליך יחיד, ומחייבת הגדרת np שווה לאחד בלבד. מעבר לכך, השילוב של מודול התמונות דרך הדגל mmproj טרם נתמך יחד עם מנגנון ההאצה הזה, מה שמאלץ לבחור בין מהירות יצירה גבוהה לבין היכולת להזין תמונות. המודל גם דורש כיוונון זהיר של תבנית השיחה והפונקציות כדי למנוע כשלים בניתוח אובייקטים מקוננים.

שאלות
נפוצות

האם אפשר להשתמש ביכולות עיבוד התמונה יחד עם מנגנון הפקת הטקסט המהיר?

כרגע לא. כרטיס המודל מבהיר שהשימוש בדגל הראייה אינו נתמך במקביל למנגנון האצת החיזוי של MTP בשרת llama.cpp, ולכן צריך לבחור בין תמיכה בקלט ויזואלי לבין יצירת טקסט מואצת.

איך מבטלים את מנגנון החשיבה המובנה כדי לחסוך זמן בפלט?

אפשר לכבות את תהליך החשיבה על ידי העברת פרמטר בתבנית השיחה של השרת, עם הערך enable_thinking מוגדר כשקר.

איך מריצים

ההרצה המקומית מתבצעת בעיקר דרך גרסה מקומפלת של llama.cpp שכוללת תמיכה בהאצת החיזוי באמצעות דגל draft-mtp. ההגדרות מחייבות לקמפל עם תמיכת CUDA ולטעון קובץ מכווץ כמו הגרסה הדינמית UD-Q4_K_XL תוך העברת תשעים ותשע שכבות לזיכרון כרטיס המסך.

אף על פי שרק חלק קטן מהפרמטרים פעיל בזמן חישוב, כל מאה עשרים ושניים מיליארד הפרמטרים חייבים לשבת בזיכרון. זה דורש מערך של כמה מאיצים ייעודיים עם זיכרון וידאו מצטבר של עשרות גיגהבייט לפחות. אם אין לכם שרת ייעודי עם חומרה ברמה הזו, קריאה לשרת מרוחק עדיפה בהרבה על ניסיון לדחוק אותו למחשב עבודה רגיל.

ollama run hf.co/unsloth/Qwen3.5-122B-A10B-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

68 קבצים במאגר, 1.7 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 סטנדרטי. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו כחלק ממוצר ולהריץ אותו באופן פנימי בחברה, ללא תשלום תמלוגים. התנאי העיקרי הוא שמירת הודעות זכויות היוצרים והרישיון המקורי בקבצים המופצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗