GPT
Q

Qwen3.5-35B-A3B-FP8

קוד פתוח

Qwenapache-2.02026-02-25

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

הוא מציע ביצועים של מודל ענק עם עלות חישובית של מודל קטן, בזכות הפעלה של 3 מיליארד פרמטרים בלבד בכל רגע. אם אתם צריכים שילוב של טקסט ותמונה בחומרה מוגבלת, זו נקודת פתיחה טובה.

  • 36Bפרמטרים
  • 262,144טוקנים בהקשר
  • 34.9 GBמשקל הקבצים
  • 1,469,426הורדות בחודש

מה זה

מדובר במודל מולטימודלי לעיבוד תמונה וטקסט, שמבוסס על שילוב של רשתות דלתא עם ארכיטקטורת תערובת מומחים. מתוך 35 מיליארד פרמטרים כוללים, המודל מפעיל רק 3 מיליארד פרמטרים בכל טוקן, מה שמקנה לו מהירות חריגה ביחס לגודלו הכולל.

במבחני ביצועים הוא עומד בכבוד מול מודלים גדולים בהרבה. במבחן הסוכנים TAU2 הוא מגיע לציון של 81.2, שגובר על דגמים מקבילים כמו GPT-5-mini, ובמבחן ההיגיון והידע MMLU-Pro הוא מציג 85.3. עם זאת, הוא נחלש במשימות מורכבות יותר כמו SWE-bench לכתיבת קוד, שם הוא עוצר בציון של 69.2.

מתאים ל

  • סוכני פעולה ומשימות רשת

    תוצאה של 81.2 ב־TAU2 הופכת אותו למועמד חזק להפעלת כלים וקריאות לפונקציות ברצף מהיר.

  • ניתוח מסמכים חזותיים

    הארכיטקטורה משלבת תמונה וטקסט מהבסיס, ומאפשרת פענוח יעיל של תמונות בלי מודל ראייה חיצוני.

  • שירותי שיחה מרובי שפות

    תמיכה מוצהרת ב־201 שפות וניבים מתאימה לפרויקטים שדורשים התאמה מקומית רחבה.

איפה זה נופל

החולשה העיקרית נחשפת במשימות קוד ומערכות הפעלה מורכבות. במבחן Terminal Bench 2 הוא משיג 40.5 בלבד, ובמבחן התכנון VITA-Bench הוא צונח ל־31.9. בנוסף, למרות שחלון ההקשר המוצהר ענקי, במבחן הקשר ארוך כמו AA-LCR הציון שלו יורד ל־58.5, כך שחובה לבדוק היטב שליפת מידע ממסמכים ארוכים לפני שסומכים עליו בפרודקשן.

אותה משפחה

Qwen3.5 יצא ב־20 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם קוונטיזציית FP8 פוגעת באיכות התשובות שלו?

היצרן מדווח שהקוונטיזציה בוצעה בגודל בלוק של 128, והביצועים כמעט זהים לחלוטין למודל המקורי. לא תרגישו ירידה מורגשת בדיוק במשימות יומיומיות.

כמה זיכרון דרוש כדי להחזיק אותו בייצור?

המשקלים עצמם דורשים כ־35 גיגה בייט זיכרון וידאו. כדי לעבוד בנוחות עם זיכרון הקשר פעיל מעבר לשאילתות קצרות, כדאי לשריין כרטיס עם לפחות 48 גיגה בייט זיכרון או זוג כרטיסים קטנים יותר.

איך מריצים

המשקלים מגיעים בקוונטיזציה של FP8 ותופסים 34.9 גיגה בייט על הדיסק, כך שכרטיס בודד של 48 גיגה בייט זיכרון יספיק כדי להריץ אותו. הקבצים נתמכים ישירות בספריות כמו transformers, vLLM ו־SGLang.

אם אין לכם שרת ייעודי או שאתם מתכננים לנצל את מלוא חלון ההקשר העצום, פתיחת הקשר מלא דורשת זיכרון נוסף שיחרוג מהכרטיס הבודד. במצב כזה, עדיף להשתמש בגרסת הענן המנוהלת Qwen3.5-Flash במקום לתחזק שרתים עצמאיים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.5-35B-A3B-FP8")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או חיצונית, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. אין מגבלות סודיות או דרישות לתמלוגים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗