GPT
Q

Qwen3.5-122B-A10B-FP8

קוד פתוח

Qwenapache-2.02026-02-25

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

זה מודל מולטימודלי בארכיטקטורת תערובת מומחים שמפעיל עשרה מיליארד פרמטרים בלבד בכל טוקן, כך שמקבלים ביצועי ענק בלי להחזיק שרת יקר ומפלצתי.

  • 125Bפרמטרים
  • 262,144טוקנים בהקשר
  • 118 GBמשקל הקבצים
  • 1,612,865הורדות בחודש

מה זה

הארכיטקטורה משלבת 122 מיליארד פרמטרים בסך הכול עם 256 מומחים, שמתוכם פועלים רק שמונה מנותבים ואחד משותף בכל רגע נתון. השילוב בין מנגנון Gated DeltaNet לבין שכבות תשומת לב מאפשר עיבוד קלט חזותי וטקסטואלי במקביל, יחד עם חלון הקשר בסיסי של 262,144 טוקנים שניתן להרחבה עד למעלה ממיליון. הוא מגיע מכויל מראש בפורמט FP8 עם בלוקים של 128 כדי לצמצם דרישות זיכרון בלי לאבד דיוק מורגש.

במבחני הביצועים הוא מציג מספרים מרשימים במיוחד בעבודת סוכנים ותכנות. ציון של 72.2 בבדיקת BFCL-V4 וציון של 49.4 ב־Terminal Bench 2 מציבים אותו מעל GPT-5-mini ומעל מודלים פתוחים מקבילים. הנתונים מראים שההתמחות שלו היא פירוק בעיות מורכבות והרצת פקודות בסביבות פיתוח, לצד תמיכה מוצהרת ב־201 שפות ודיאלקטים.

מתאים ל

  • סוכני אוטומציה וטרמינל

    התוצאה הגבוהה במבחן Terminal Bench 2 מתאימה להרצת פקודות בסביבות פיתוח ואינטגרציה ללא מגע יד אדם.

  • ניתוח מסמכים ותמונות

    חלון הקשר של מאות אלפי טוקנים בשילוב תמיכה מובנית בתמונות מאפשר לתחקר חוזים, תרשימים ודוחות גרפיים בבת אחת.

  • תמיכה בריבוי שפות

    אימון מקדים על 201 שפות ודיאלקטים נותן מענה לפרויקטים גלובליים שדורשים תרגום ועיבוד שפה ללא מודל ייעודי נפרד.

איפה זה נופל

למרות החוזק בסוכנים, במשימות תכנות תחרותי טהורות הוא רושם נסיגה קלה. בדירוג CodeForces הוא מגיע ל־2100, תוצאה נמוכה מעט מגרסאות אחרות, ובמבחן LiveCodeBench v6 הוא מקבל 78.9 לעומת 82.7 של מתחרים פתוחים אחרים. בנוסף, משימות הבנה מורכבות כמו HLE מניבות רק 25.3 אחוז הצלחה, מה שמעיד על מגבלה ממשית בחשיבה מופשטת.

המשקל העצום של 53 קבצים מקשה על פריסה מהירה ועל זמני אתחול של שרתים. אם אתם צריכים בעיקר יכולות שפה בעברית, נדרשת בדיקה יסודית מראש, כי הכרטיס מציין תמיכה רחבה במאות שפות אך אינו מפרט תוצאות מבחן ייעודיות לעברית.

אותה משפחה

Qwen3.5 יצא ב־20 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס גרפי בודד של 24GB?

לא. משקל הקבצים בפורמט FP8 הוא 118GB, ולכן המודל פשוט לא ייכנס לזיכרון של כרטיס יחיד כזה. תצטרכו שרת עם לפחות שני כרטיסים של 80GB כדי לטעון אותו ולהשאיר מקום לשאילתות.

האם הכיול ל־FP8 פוגע בביצועים לעומת המודל המקורי?

היצרן מדווח שהכיול נעשה בבלוקים של 128 ושהמדדים כמעט זהים לחלוטין למודל המקורי. בפועל מקבלים את אותן היכולות בחצי מנפח הזיכרון שהיה נדרש למודל ב־16 ביט.

כמה מהר הוא מייצר טוקנים ביחס לגודל שלו?

בזכות ארכיטקטורת MoE, רק עשרה מיליארד פרמטרים מופעלים בכל צעד חישוב מתוך 122 מיליארד. זה אומר שמהירות התגובה וזמן ההמתנה לטוקן דומים למודל קטן, בזמן שנפח הידע נשאר של מודל ענק.

איך מריצים

כדי להעלות את 118 הגיגהבייט של המודל לזיכרון בפורמט FP8 תצטרכו שרת עם לפחות שני כרטיסי A100 או H100 בנפח 80GB כל אחד, או ארבעה כרטיסי L40S. אם רוצים לנצל חלון הקשר ארוך מעבר לכמה עשרות אלפי טוקנים, תוספת הזיכרון ל־KV cache תדרוש חומרה רחבה עוד יותר. המודל רץ ישירות דרך ספריות כמו vLLM, SGLang, Hugging Face Transformers או KTransformers.

אם המוצר שלכם לא מחייב פרטיות מוחלטת והחזקת הנתונים על ברזלים מקומיים, עדיף בהרבה להשתמש ב־API מנוהל. הקמה ותחזוקה של צבר שרתים כזה רק בשביל להחזיק מודל דלוק עולות אלפי דולרים בחודש, סכום שקשה להצדיק בלי תעבורה שוטפת של מיליוני שאילתות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.5-122B-A10B-FP8")
print(pipe("שלום"))

הקבצים

53 קבצים במאגר, 118 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המשקלים, שילוב במוצרים סגורים והפצה מחדש, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗