GPT
Q

Qwen3.5-35B-A3B

קוד פתוח

Qwenapache-2.02026-02-24

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

שילוב של 35 מיליארד פרמטרים שמהם רק 3 מיליארד פעילים בכל רגע יוצר מודל מולטימודלי מהיר במיוחד. הוא מיועד למי שצריך יכולות חשיבה ועיבוד תמונה בלי לשלם בחומרה על מודל ענק.

  • 36Bפרמטרים
  • 262,144טוקנים בהקשר
  • 67.0 GBמשקל הקבצים
  • 2,290,236הורדות בחודש

מה זה

מדובר במודל שפה ותמונה מסוג תערובת מומחים שכולל 256 מומחים בסך הכול, אך מפעיל רק 9 מתוכם לכל טוקן. הארכיטקטורה משלבת שכבות Gated DeltaNet עם מנגנוני קשב דלילים כדי לשמור על קצב הפקה גבוה וזמני תגובה קצרים, לצד חלון הקשר בסיסי של 262,144 טוקנים שניתן להרחבה עד מעל מיליון.

במדדי ביצועים המודל מציג תוצאות מפתיעות לגודלו. בבדיקות תכנות כמו SWE-bench Verified הוא מגיע לציון 69.2, ובמדד הסוכנים TAU2-Bench הוא משיג 81.2 ועוקף גם מודלים גדולים ממנו בהרבה בסדרה. עם זאת, הוא לא מיועד להחליף מודלי קצה מלאים בתחומים של ידע מעמיק או משימות קוד מורכבות במיוחד, שם גרסאות ה־122B שומרות על יתרון עקבי.

מתאים ל

  • סוכני אוטומציה לפקודות

    התוצאה הגבוהה במבחן TAU2-Bench הופכת אותו למועמד מצוין לקריאת פונקציות וביצוע משימות אוטונומיות בסביבות תפעול.

  • ניתוח מסמכים חזותיים

    שילוב עיבוד תמונה וטקסט עם הקשר ארוך מתאים לחילוץ נתונים מדוחות סרוקים, תרשימים וטפסים מורכבים.

  • שרתי הסקה מרובי פניות

    הפעלת 3 מיליארד פרמטרים בלבד בזמן ריצה מאפשרת לקבל תפוקת טוקנים גבוהה וזמני תגובה קצרים בעומס משתמשים.

איפה זה נופל

למרות השליטה הטובה בסוכנים, המודל מתקשה במשימות תכנון מורכבות ואיסוף מידע רחב, כפי שמשתקף בציון נמוך של 31.9 בלבד במבחן VITA-Bench. יכולות הקוד שלו במבחנים סינתטיים קשים דוגמת CodeForces ו־OJBench נמוכות יותר מאשר במודלים צפופים בגודל דומה. בנוסף, אף שהכרטיס מציין תמיכה ב־201 שפות, הביצועים בעברית אינם מפורטים בבנצ'מרקים ודורשים בדיקה זהירה של איכות הפלט וההבנה של הנחיות מורכבות לפני שילוב במוצר.

אותה משפחה

Qwen3.5 יצא ב־20 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי בודד?

לא בפורמט הנוכחי. משקל המודל הוא 67 גיגה בייט ומחייב לפחות 80 גיגה בייט של זיכרון גרפי להרצה בסיסית. כדי לנסות להריץ אותו מקומית על חומרה צרכנית תצטרכו להמתין לגרסאות מכווצות ברמת קוונטיזציה נמוכה או להשתמש בכלים כמו KTransformers שפורקים שכבות לזיכרון המערכת.

למה לבחור בו במקום במודל צפוף של 27B?

היתרון של המודל הוא יעילות בזמן הפקה. בזכות ארכיטקטורת המומחים הוא מפעיל כעשירית מכוח החישוב בכל צעד, ומספק מהירות גבוהה יותר תוך שמירה על ציונים טובים יותר במשימות הפעלת סוכנים וכלים.

איך מריצים

המשקל הכולל של הקבצים עומד על 67 גיגה בייט, כך שכדי להריץ אותו ישירות בפורמט המקורי נדרשים כרטיסי מסך עם נפח זיכרון כולל של לפחות 80 גיגה בייט. המודל נתמך ישירות בספריות transformers, vLLM, SGLang ו־KTransformers, שמסוגלות לנהל את ניתוב המומחים ביעילות.

אם אין לכם שרת ייעודי עם כרטיסי H100 או זוג A100, עדיף להשתמש ב־API מנוהל של ענן עליבאבא שמציע את גרסת Qwen3.5-Flash המקבילה. הרצה עצמית בשרת ענן שכור תהיה יקרה ומיותרת אלא אם חובה עליכם לשמור את המידע מקומית מטעמי אבטחה ופרטיות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.5-35B-A3B")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי הקוד והמשקלים, הפצה ושילוב במוצרים סגורים ללא תשלום תמלוגים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗