GPT
Q

Qwen3.6-35B-A3B-FP8

קוד פתוח

Qwenapache-2.02026-04-15

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

השילוב בין 35 מיליארד פרמטרים כוללים לרק 3 מיליארד מופעלים בכל טוקן נותן מודל תכנות כבד שרץ בקצב של מודל קל. הוא מגיע כבר בקוונטיזציית FP8 כדי להיכנס ישירות לכרטיס גרפי בודד.

  • 36Bפרמטרים
  • 262,144טוקנים בהקשר
  • 34.9 GBמשקל הקבצים
  • 12,372,077הורדות בחודש

מה זה

מדובר במודל שפת תמונה וטקסט בארכיטקטורת תערובת מומחים עם 256 מומחים בסך הכול, שמפעיל רק 8 מומחים מנותבים ועוד אחד משותף בכל צעד. המבנה הפנימי משלב שכבות Gated DeltaNet יחד עם מנגנון קשב סטנדרטי כדי לחסוך זיכרון ולשמור על מהירות. המשקלים עברו קוונטיזציה עדינה מסוג FP8 בגודל בלוק של 128, והיצרן טוען שהיא שומרת על ביצועים זהים כמעט לחלוטין למקור.

במבחני קידוד מעשיים הוא מתבלט במיוחד. במבחן SWE-bench Verified הוא מגיע לציון של 73.4, וב־Terminal-Bench 2.0 הוא קופץ ל־51.5 לעומת 40.5 בלבד בדור הקודם. המשמעות היא יכולת טובה משמעותית להבין סביבת שורת פקודה, לערוך קבצים ולנהל משימות מאגר מלאות בצורה אוטונומית.

מתאים ל

  • סוכן קידוד למאגרים

    הוא מגיע ל־73.4 ב־SWE-bench וכולל שמירת הקשר מחשבה, מה שמתאים לעריכת קבצים מורכבת.

  • ניתוח מסמכים ארוכים עם צילומים

    עם קלט תמונה מובנה וחלון בסיסי של 262,144 טוקנים, הוא קורא תיעוד עמוס באיורים בקלות.

  • אוטומציה בטרמינל

    ציון של 51.5 ב־Terminal-Bench 2.0 הופך אותו לבחירה טובה להרצת פקודות בסביבת לינוקס.

איפה זה נופל

למרות החוזק בקוד, במשימות תכנון וסוכנים כלליים המודל מציג חולשה ברורה. במבחן VITA-Bench הוא קיבל רק 35.6 נקודות, נמוך בהרבה מ־Qwen3.5-27B שהגיע ל־41.8. במבחן Tool Decathlon הוא רשם 26.9 לעומת 31.5 במודל הדור הקודם, וב־HLE הוא קיבל 21.4 בלבד. לפני שאתם בונים עליו תהליכי אוטומציה מורכבים שאינם קשורים ישירות לקוד, תבדקו היטב אם יכולת קבלת ההחלטות שלו מספיקה לכם.

אותה משפחה

Qwen3.6 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס RTX 4090 ביתי בודד?

לא. המשקלים לבדם תופסים כמעט 35 גיגה בייט ב־FP8, בעוד שלכרטיס ביתי יש לכל היותר 24 גיגה בייט. תצטרכו שני כרטיסים כאלה או כרטיס בודד של 48 גיגה כדי להפעיל אותו.

במה הוא שונה מגרסת Qwen3.5 הקודמת באותו הגודל?

הגרסה החדשה מביאה שיפור חד במשימות פיתוח וקוד טרמינל, עם עלייה של יותר מעשר נקודות ב־Terminal-Bench 2.0. לצד זה היא מציגה תכונה לשמירת הקשר המחשבה בין הודעות כדי לשפר איטרציות עבודה.

איך מריצים

המשקלים תופסים 34.9 גיגה בייט בפורמט FP8, כך שאתם צריכים כרטיס גרפי מקצועי עם לפחות 48 גיגה זיכרון כדי לטעון אותו, לשמור מקום ל־KV cache ולהשתמש בחלון ההקשר העצום. הוא נתמך ישירות בספריות כמו vLLM, SGLang, transformers ו־KTransformers.

אם אין לכם חומרה ייעודית כזו בענן או במשרד, אל תנסו לדחוף אותו למחשב אישי חלש כי הוא פשוט לא ייכנס לזיכרון. במקרה כזה עדיף לקרוא למודל דרך ספק API חיצוני, במיוחד כשתרצו לנצל הקשרים ארוכים שמנפחים את צריכת הזיכרון עוד יותר.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.6-35B-A3B-FP8")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון Apache 2.0 פתוח לגמרי. אתם יכולים להשתמש בו ליישומים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו בתוך מוצרים בלי לשלם תמלוגים, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗