GPT
Q

Qwen3.6-35B-A3B

קוד פתוח

Qwenapache-2.02026-04-15

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

זה מודל MoE עם ראייה שמפעיל רק שלושה מיליארד פרמטרים מתוך שלושים ושישה בפועל. מי שבוחר בו מחפש ביצועי תכנות של מודל ענק בריצה מהירה בהרבה.

  • 36Bפרמטרים
  • 262,144טוקנים בהקשר
  • 67.0 GBמשקל הקבצים
  • 4,243,308הורדות בחודש

מה זה

מדובר במודל שמערבב טקסט ותמונה, בנוי על שילוב של שכבות Gated DeltaNet עם מנגנון מומחים של 256 מומחים, שמתוכם פועלים בכל רגע שמונה מנותבים ואחד משותף. המבנה הזה נותן לו תגובה מהירה יחסית למודלים דחוסים בגודל דומה, יחד עם חלון הקשר מקורי של 262,144 טוקנים שניתן להרחבה עד מעל מיליון.

החוזק העיקרי שמוצג בבנצ'מרקים הוא סביב סוכני פיתוח ותכנות. במבחן SWE-bench Verified הוא עומד על 73.4 ובמבחן Terminal-Bench 2.0 מגיע ל־51.5, תוצאות שעוקפות מודלים כמו Gemma4 המקבילים לו ומציגות שיפור מורגש לעומת גרסת ה־3.5 הקודמת. במבחני שפה וידע כללי כמו MMLU-Pro הוא נשאר צמוד למתחרים סביב 85.2, כך שההבדל העיקרי מורגש בעיקר כשנותנים לו לנתח קוד, להריץ פקודות מסוף או לעבוד מול ריפו שלם.

מתאים ל

  • סוכן תכנות מבוסס מסוף

    מתאים להרצת פקודות וניתוח שגיאות בזכות תוצאה של 51.5 ב־Terminal-Bench 2.0.

  • ניתוח קוד וממשקי תוכנה

    משלב קלט תמונה וטקסט עם הקשר ארוך כדי לסרוק עיצובי ממשק לצד מאגרי קוד.

  • תיקון באגים בריפו קיים

    מיועד למשימות ריפו שלמות עם ציון של 73.4 ב־SWE-bench Verified.

איפה זה נופל

למרות השדרוג ביכולות הקוד, במשימות תכנון רחבות וסוכנים כלליים המספרים צונחים. במבחן DeepPlanning הוא מגרד רק 25.9 וב־Tool Decathlon מגיע ל־26.9, כך שהוא רחוק מלהיות מושלם כשמטילים עליו משימות תפעוליות מורכבות מחוץ לסביבת פיתוח מוגדרת. בנוסף, ב־SWE-bench Verified ובמבחני SWE נוספים, מודל ה־Dense הישן יותר Qwen3.5-27B עדיין מציג תוצאות מעט גבוהות יותר, כך שארכיטקטורת ה־MoE לא תמיד עדיפה בכל תרחיש.

אותה משפחה

Qwen3.6 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל ירוץ על כרטיס מסך בודד של 24GB?

לא בגרסה הזו. הקבצים שוקלים 67 גיגה בייט ודורשים לפחות כרטיס של 80 גיגה בייט כדי לטעון את כל המומחים לזיכרון. כדי להריץ על חומרה צרכנית תצטרכו לחכות לגרסאות מכווצות בקוונטיזציה.

מה נותן מנגנון ה־Thinking Preservation שהוסיפו כאן?

האפשרות הזו שומרת את שרשרת החשיבה וההקשר של המודל מהודעות קודמות בשיחה. זה מונע ממנו לחשב מחדש את כל שלבי ההיגיון בכל שלב איטרטיבי של כתיבת קוד וחוסך זמן עיבוד.

איך מריצים

המשקל הכולל של הקבצים עומד על 67 גיגה בייט, מה שאומר שכדי להחזיק את כל המשקולות בזיכרון תצטרכו כרטיס מקצועי של 80 גיגה בייט כמו A100 או H100, או פיצול על שני כרטיסי 48 גיגה בייט. למרות שהוא מפעיל רק 3B פרמטרים בזמן חישוב ומייצר טוקנים מהר, הזיכרון חייב להכיל את כל 35B הפרמטרים.

אפשר להריץ אותו דרך ספריות כמו vLLM, SGLang, KTransformers או Transformers הרגילה. אם אין לכם שרת ייעודי כזה פנוי או שאתם לא מריצים עומס רציף שמצדיק עלות שרת חודשית יקרה, עדיף לקרוא לו דרך API מנוהל.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.6-35B-A3B")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות משוחררים תחת רישיון Apache 2.0. הרישיון מאפשר שימוש מסחרי חופשי, שינוי של המודל, אימון נוסף והפצה בתוך מוצרים מסחריים בלי תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗