GPT
Q

Qwen3.5-122B-A10B-GGUF

קוד פתוח

unslothapache-2.02026-02-24

  • transformers
  • gguf
  • qwen3_5_moe
  • image-text-to-text
  • unsloth

מודל שפה ותמונה גדול שמפעיל רק עשרה מיליארד פרמטרים מתוך מאה עשרים ושניים בכל צעד חישוב. תקבלו יכולות של מודל ענק עם זמני תגובה מהירים בהרבה.

  • 262,144טוקנים בהקשר
  • 1.7 TBמשקל הקבצים
  • 514,714הורדות בחודש
  • 297לייקים

מה זה

מדובר במודל היברידי מסוג תערובת מומחים שמשלב עיבוד טקסט ותמונה יחד. הוא כולל מאתיים חמישים ושישה מומחים שמתוכם שמונה מנותבים ואחד משותף פעילים בכל רגע נתון. המבנה הפנימי מחבר שכבות מיוחדות של רשתות דלתא עם שכבות קשב כדי לאפשר פעולה מהירה גם כשהקלט מתארך מאוד.

במדדי ההערכה הוא מציג מספרים גבוהים במיוחד. במבחן הסוכנים BFCL-V4 הוא מגיע לציון שבעים ושניים נקודה שתיים, גבוה משמעותית מגרסת הדגל הקודמת ומשאר הדגמים בסדרה. הוא מתחרה היטב במבחני ידע וחשיבה מדעית כמו MMLU Pro ו־GPQA Diamond, שבהם הוא עוקף מודלים סגורים ופתוחים מתחרים, וגם בעבודה עם שורת הפקודה בטרמינל הוא קיבל תוצאה בולטת של ארבעים ותשע נקודה ארבע.

מתאים ל

  • סוכני אוטומציה וכלים

    התוצאה שלו במבחני הפעלת כלים גבוהה במיוחד, והוא מצטיין בניווט וביצוע פקודות בסביבת טרמינל.

  • ניתוח מסמכים ותמונות

    אימון הבסיס משלב טקסט ותמונה יחד, מה שחוסך שימוש במודל ראייה נפרד.

  • פתרון בעיות מדעיות

    הוא מציג דיוק גבוה במבחני GPQA ומתאים לחקירה של חומרים אקדמיים עמוקים.

איפה זה נופל

במבחני תכנות תחרותיים כמו CodeForces המודל מקבל דירוג אלפיים ומאה, שזה נמוך יותר ממודלים מתחרים באותו סדר גודל ואפילו מגרסאות עבר מסוימות. בנוסף, הוא מוגדר כמודל חושב כברירת מחדל. אם לא תבטלו את מצב החשיבה בהגדרות התבנית בעזרת הפקודה הייעודית, המודל ייקח זמן חישוב ממושך וייצר טוקנים מיותרים גם עבור משימות קצרות ופשוטות.

אותה משפחה

Qwen3.5 יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מבטלים את זמן החשיבה הארוך שלו בתשובות פשוטות?

אפשר לכבות את מנגנון ההיסק דרך ארגומנט תבנית השיחה בהגדרות ההרצה. שולחים את המפתח שמבטל את החשיבה ומקבלים תגובה ישירה בלי שרשרת מחשבה פנימית.

למה מופיע נפח הורדה של מעל טרה־בייט וחצי?

המאגר מכיל עשרות קבצים שמייצגים רמות כיווץ שונות של המודל. מורידים רק את הקובץ הספציפי שמתאים לחומרה ולרמת הדיוק שאתם צריכים ולא את כל המאגר.

איך מריצים

המודל מופץ כאן בפורמט מכווץ שמיועד להרצה בספריות תואמות כמו llama.cpp, vLLM, SGLang או KTransformers. הקבצים בכרטיס המודל תופסים נפח כולל של טרה־בייט ונקודה שבע, כך שלא מורידים את הכל אלא בוחרים קובץ מכווץ בודד שמתאים לנפח הזיכרון שלכם. כדי להריץ משקל של מעל מאה מיליארד פרמטרים תצטרכו שרת עם כמה כרטיסי מסך חזקים או שילוב כבד של זיכרון מערכת וכרטיס גרפי.

אם אתם לא מחזיקים שרת ייעודי שפועל מסביב לשעון, החומרה הזו פשוט יקרה מדי לחשבון החשמל ולרכש. במקרה כזה כדאי להשתמש ב־API חיצוני של מי שמארח את המודל, ולשמור את ההרצה העצמית רק לתרחישים של מידע רגיש או ניתוק מוחלט מהאינטרנט.

ollama run hf.co/unsloth/Qwen3.5-122B-A10B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

71 קבצים במאגר, 1.7 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, להפיץ אותו מחדש ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗