GPT
Q

Qwen3.5-397B-A17B

קוד פתוח

Qwenapache-2.02026-02-16

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל מולטימודלי ענק שמפעיל רק חלק קטן מעוצמת החישוב שלו בכל שלב. הוא נותן חלון הקשר של רבע מיליון טוקנים יחד עם יכולת ראייה מובנית.

  • 403Bפרמטרים
  • 262,144טוקנים בהקשר
  • 751 GBמשקל הקבצים
  • 173,365הורדות בחודש

מה זה

מדובר במודל MoE עם 403 מיליארד פרמטרים כוללים, שמפעיל בפועל 17 מיליארד פרמטרים בכל טוקן. המבנה שלו משלב שכבות ליניאריות של Gated DeltaNet עם שכבות תשומת לב רגילות. הוא מאומן מהיסוד על טקסט ותמונות יחד, ותומך ב־201 שפות ודיאלקטים עם חלון הקשר בסיסי של 262,144 טוקנים שניתן להרחבה עד מיליון.

במדדי ההוראות כמו IFBench הוא מגיע ל־76.5 ועוקף שמות כבדים כמו GPT5.2, מה שאומר שהוא יודע לציית למגבלות ניסוח מדויקות. גם במבחני סוכנים וכלים כמו BFCL-V4 הוא רושם 72.9 ומציג יכולת טובה של הפעלת פונקציות. לעומת זאת, במתמטיקה ובקוד תחרותי הוא לא שובר שיאים. ב־LiveCodeBench v6 הוא עומד על 83.6 וב־GPQA על 88.4, תוצאות חזקות אבל נמוכות מהמובילים בסגמנט.

מתאים ל

  • סוכני שיחה והפעלת כלים

    ציונים גבוהים במדדי מעקב הוראות וסוכנים הופכים אותו למתאים לקריאות לפונקציות ואינטגרציות חיצוניות.

  • ניתוח מסמכים ארוכים עם תמונות

    חלון של 262,144 טוקנים יחד עם הבנת תמונה טבעית מאפשרים לעבד דוחות עתירי גרפים ומסמכים סרוקים בבת אחת.

  • תמיכה במערכות רב לשוניות

    כיסוי של 201 שפות וניבים מתאים ליישומים שדורשים תרגום ועיבוד שפה גלובלי בלי לאבד את ההקשר התרבותי.

איפה זה נופל

החולשה העיקרית מופיעה במשימות חשיבה קיצוניות. במבחן HLE שבודק שאלות מורכבות ברמת מומחה, המודל מקבל 28.7 בלבד, ציון נמוך משמעותית ממתחרים כמו GPT5.2 ו־Gemini-3 Pro. גם ב־DeepPlanning הוא מגיע ל־34.3, מה שמראה שבתכנון משימות מורכבות וארוכות הוא נוטה לאבד כיוון. בנוסף, חלון ההקשר הגדול דורש משאבי זיכרון קיצוניים, כך שאם לא מנהלים את החומרה נכון הריצה עלולה לקרוס.

אותה משפחה

Qwen3.5 יצא ב־20 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על שרת מקומי קטן?

לא. המשקלים לבדם שוקלים 751 גיגה בייט, מה שמחייב קלאסטר ארגוני של כרטיסי מסך חזקים. למשתמש בודד או לצוות קטן ללא חוות שרתים, השימוש הריאלי הוא רק דרך שירות ה־API.

מה המשמעות של 17 מיליארד פרמטרים פעילים?

למרות שבזיכרון יושבים 403 מיליארד פרמטרים, בכל שלב של יצירת מילה המודל מנתב את המידע רק לחלק מהמומחים. בפועל מהירות הריצה דומה למודל קטן יותר של 17 מיליארד פרמטרים, אבל עם הדיוק והידע של מודל ענק.

איך מריצים

כדי להריץ אותו עצמאית צריך תשתית רצינית מאוד. המשקלים תופסים 751 גיגה בייט ומחולקים ל־107 קבצים. זה אומר שתצטרכו שרת עם שמונה כרטיסי H100 או A100 של 80 גיגה רק כדי לטעון את המודל לזיכרון לפני שמחשבים את זיכרון הריצה לחלון הקשר ארוך. אפשר להריץ אותו דרך ספריות כמו vLLM, SGLang, KTransformers או Transformers הרגילה.

אם אין לכם קלאסטר כזה פנוי בחווה או בענן, עדיף לפנות ישירות לגרסת ה־API המנוהלת של עליבאבא, שנקראת Qwen3.5-Plus. היא מגיעה כבר עם הקשר של מיליון טוקנים מובנה וכלי עבודה מוכנים, בלי שתצטרכו לשלם על תחזוקת שרתים כבדה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.5-397B-A17B")
print(pipe("שלום"))

הקבצים

107 קבצים במאגר, 751 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, להפיץ אותם מחדש ולשלב אותם בתוך מוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗