GPT
Q

Qwen3.5-397B-A17B-FP8

קוד פתוח

Qwenapache-2.02026-02-18

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל מולטימטודלי ענק עם ארכיטקטורת תערובת מומחים שמפעילה רק 17 מיליארד פרמטרים בכל טוקן, כך שמקבלים יכולות של מודל דגל במשקל ריצה נמוך משמעותית.

  • 403Bפרמטרים
  • 262,144טוקנים בהקשר
  • 378 GBמשקל הקבצים
  • 771,504הורדות בחודש

מה זה

מדובר במודל מולטימודלי שמקבל טקסט ותמונות ופולט טקסט. למרות נפח כולל של קרוב ל־400 מיליארד פרמטרים, מבנה ה־MoE שלו כולל 512 מומחים ומנתב רק 10 מומחים רגילים ועוד אחד משותף לכל פעולה, מה שמייצר בפועל עלות חישוב של מודל קטן בהרבה. הארכיטקטורה משלבת Gated Delta Networks יחד עם תשומת לב מסורתית, ומציעה חלון הקשר בסיסי של 262,144 טוקנים הניתן להרחבה מעבר למיליון.

במבחני הביצועים הוא עומד בכבוד מול המודלים המסחריים המובילים. במעקב אחר הוראות מורכבות במבחן IFBench הוא הגיע לתוצאה של 76.5 ועקף שמות כמו GPT-5.2 ו־Claude 4.5 Opus. ביכולות סוכנים ושימוש בכלים הוא מציג ציונים חזקים מאוד של 72.9 ב־BFCL-V4 ו־86.7 ב־TAU2-Bench, אם כי במשימות תכנון מורכבות של DeepPlanning הוא נעצר ב־34.3 ומפגר אחרי מובילי השוק.

מתאים ל

  • סוכנים אוטונומיים וכלים

    התוצאות ב־BFCL וב־TAU2-Bench מראות שהוא יודע להפעיל פונקציות ולקבל החלטות סביבתיות בצורה מדויקת מאוד.

  • מעקב אחר הוראות מחמירות

    הציון הגבוה ב־IFBench מעיד על יכולת מעולה להיצמד למבנים נוקשים, פורמטים מוגדרים ואילוצי פלט.

  • ניתוח מסמכים ארוכים

    חלון הקשר מקורי של 262 אלף טוקנים מאפשר לבלוע קבצי ענק, חוזים או תיעוד טכני מלא בשאילתה אחת.

איפה זה נופל

החולשה הבולטת ביותר שלו מופיעה במשימות חשיבה מתמטית ופתרון בעיות קצה. במבחן HLE הוא קיבל 28.7 בלבד, ובמבחן HLE-Verified הגיע ל־37.6, נמוך בהרבה ממתחריו הבכירים. גם במבחן הקוד LiveCodeBench v6 הוא הגיע ל־83.6, שזו תוצאה טובה אך נמוכה מכל המודלים המובילים האחרים בטבלה. אל תבנו עליו למשימות מורכבות של תכנון ארוך טווח או הוכחות מתמטיות סבוכות.

אותה משפחה

Qwen3.5 יצא ב־20 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל תומך בעברית?

כרטיס המודל מציין תמיכה מורחבת ב־201 שפות ודיאלקטים שונים. עם זאת, אין בתיעוד תוצאות מבחנים ספציפיות בעברית, ולכן חובה לבדוק את איכות הפלט וההבנה על טקסט מקומי לפני שילוב במערכת חיה.

מה היתרון של גרסת FP8 לעומת משקלים מלאים?

גרסת ה־FP8 עברה קוונטיזציה עדינה בבלוקים של 128 שמקצצת בחצי את דרישות הזיכרון בהשוואה ל־FP16. המפתחים מציינים שמדדי הביצועים של הגרסה המכווצת כמעט זהים לחלוטין למודל המקורי.

אפשר להריץ אותו על שרת יחיד עם כרטיס בודד?

חד משמעית לא. הקבצים עצמם שוקלים 378 גיגה־בייט, כך שגם לטעינה בסיסית של המשקלים נדרש מערך מרובה כרטיסי מסך מקצועיים בעלי זיכרון VRAM מצטבר של לפחות 500 גיגה־בייט.

איך מריצים

המשקל הכולל של הקבצים בגרסת FP8 מגיע ל־378 גיגה־בייט הפרוסים על פני 107 קבצים. כדי לטעון אותו לזיכרון תצטרכו שרת עם לפחות 8 כרטיסי GPU של 80GB כל אחד, כמו H100 או A100, כדי להשאיר מקום לטנזורים ולחלון ההקשר. המודל נתמך ישירות בספריות vLLM, SGLang, KTransformers ו־Transformers הרגילה.

אם אין לכם קלאסטר שרתים ייעודי כזה בחברה, אין שום היגיון כלכלי או טכני לנסות להרים אותו באופן עצמאי. במקרה כזה עדיף לפנות ישירות ל־API המנוהל של Alibaba Cloud דרך Model Studio, שם הגרסה המקבילה מגיעה מראש עם תמיכה מובנית בכלים ובהקשר של מיליון טוקנים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.5-397B-A17B-FP8")
print(pipe("שלום"))

הקבצים

107 קבצים במאגר, 378 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון apache-2.0 מלא. הרישיון הזה מתיר שימוש מסחרי חופשי לחלוטין, שינוי של הקוד והמשקלים, הפצה מחדש והטמעה במוצרים סגורים, בלי צורך לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗