GPT
Q

Qwen3.5-35B-A3B-GGUF

קוד פתוח

unslothapache-2.02026-02-24

  • gguf
  • qwen3_5_moe
  • unsloth
  • image-text-to-text
  • endpoints_compatible

זהו מודל מולטימודלי בארכיטקטורת תערובת מומחים שמפעיל רק 3 מיליארד פרמטרים מתוך 35 בפועל. הוא מאפשר ריצה מקומית מהירה מאוד עם תמיכה בעיבוד תמונה, קוד וחלון הקשר עצום.

  • 262,144טוקנים בהקשר
  • 537 GBמשקל הקבצים
  • 201,183הורדות בחודש
  • 863לייקים

מה זה

הארכיטקטורה כאן משלבת Gated Delta Networks יחד עם 256 מומחים, כאשר בכל רגע נתון פועלים רק 8 מומחים מנותבים ואחד משותף. המבנה הזה מקטין דרסטית את העומס החישובי בזמן יצירת הטוקנים לעומת מודלים צפופים רגילים, תוך שמירה על קיבולת ידע של מודל בינוני.

במבחני ביצועים הוא עומד על 85.3 ב־MMLU-Pro וציון של 69.2 ב־SWE-bench Verified, תוצאות שמציבות אותו קרוב מאוד למודלים צפופים גדולים ממנו כמו Qwen3.5-27B. יחד עם זאת, בבדיקות תכנות מורכבות יותר כמו LiveCodeBench v6 הוא משיג 74.6, פחות מגרסת ה־27B הצפופה שמגיעה ל־80.7.

מתאים ל

  • סוכן לפיתוח תוכנה

    משיג 69.2 ב־SWE-bench Verified ומתאים לכלי קוד כמו Claude Code ו־Codex.

  • ניתוח מסמכים ארוכים ותמונות

    שילוב של עיבוד תמונה וחלון הקשר של 262,144 טוקנים מאפשר לקרוא מסמכים עתירי גרפים.

  • שירות צ'אט מקומי מהיר

    הפעלת 3 מיליארד פרמטרים בלבד בכל שלב מייצרת זמני תגובה קצרים על כרטיס בודד.

איפה זה נופל

למרות שהוא מתוכנן להקשר ארוך, במבחן AA-LCR הוא רושם ירידה חדה ל־58.5 נקודות לעומת 66.1 בגרסת ה־27B. בנוסף, בביצוע פקודות מדויקות במבחן IFBench הוא יורד ל־70.2, כך שלא הייתי סומך עליו בעיניים עצומות במשימות שמחייבות היצמדות קפדנית לפורמט מורכב.

אותה משפחה

Qwen3.5 יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

כמה זיכרון וידאו בפועל צריך כדי להריץ אותו?

עבור כימות סטנדרטי כמו Q4_K_M צריך כרטיס עם 24 גיגה בייט זיכרון כדי להריץ שאלות קצרות. אם תרצו לפתוח עשרות אלפי טוקנים בהקשר, תצטרכו כרטיס נוסף או מעבר לשרת ענן.

איך מנטרלים את מנגנון ה־Thinking שלו?

אפשר לכבות את החשיבה ישירות בהגדרות הטמפלייט בעזרת הדגל enable_thinking שמוגדר כ־false.

האם הוא תומך בריצה דרך vLLM?

כן, המשקלים והארכיטקטורה מותאמים לריצה ישירה בספריות כמו Hugging Face Transformers, vLLM ו־SGLang.

איך מריצים

המשקל הכולל של הקבצים במאגר עומד על 537 גיגה בייט בגלל פיצול למגוון כימותים, אך בפועל מורידים קובץ בודד בהתאם לזיכרון הפנוי שלכם. גרסאות כמו Q4_K_M דורשות פחות מ־25 גיגה בייט זיכרון וידאו, מה שמתאים לכרטיס RTX 3090 או 4090 בודד, בעוד גרסאות מלאות כמו BF16 דורשות לפחות 70 עד 80 גיגה בייט של VRAM.

אם אתם צריכים לפתוח את כל חלון ההקשר המלא של 262,144 טוקנים, דרישת הזיכרון ל־KV Cache תזנק במהירות ותחייב חומרה של תחנת עבודה רצינית. במקרים כאלה עדיף לגשת ישירות לשירות ענן כמו Qwen3.5-Flash ב־Alibaba Cloud במקום לתחזק שרת מקומי.

ollama run hf.co/unsloth/Qwen3.5-35B-A3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי קוד, והפצה ללא תמלוגים. אתם יכולים לשלב אותו במוצרים פנימיים או חיצוניים, בתנאי שתשמרו על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗