GPT
Q

Qwen3-235B-A22B-Instruct-2507

קוד פתוח

Qwenapache-2.02025-07-21

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת MoE ענקית שרצה במהירות של מודל קטן בהרבה, ומיועדת למי שחייב מודל פתוח לחלוטין עם הקשר עצום של עד מיליון טוקנים בלי בלוקים של חשיבה.

  • 235Bפרמטרים
  • 262,144טוקנים בהקשר
  • 438 GBמשקל הקבצים
  • 147,293הורדות בחודש

מה זה

מדובר בארכיטקטורת תערובת מומחים שכוללת 235 מיליארד פרמטרים בסך הכול, אבל מפעילה רק 22 מיליארד בכל טוקן. המשמעות היא שאתם מחזיקים מודל ענק בזיכרון, אבל החישוב בפועל מהיר מאוד ומגיב מיד ללא שלבי חשיבה פנימיים. גרסת ההוראות הזו מציגה קפיצה ניכרת במתמטיקה עם ציון 70.3 במבחן AIME25 לעומת 24.7 בגרסה הקודמת, ובמבחן ההיגיון ZebraLogic היא מגיעה ל־95 נקודות.

המודל מגיע עם תמיכה טבעית ב־262,144 טוקנים וניתן להרחבה עד 1,010,000 טוקנים באמצעות מנגנוני Dual Chunk Attention וקשב דליל. במבחני אחזור מידע בהקשר של מיליון טוקנים, הוא שומר על דיוק של 82.5 אחוזים בקשב דליל, שזה נתון שמחזיק מסמכים שלמים בלי לאבד את הידיים והרגליים.

מתאים ל

  • סוכנים אוטונומיים

    קיבל 70.9 במבחן BFCL-v3 ומיועד להפעלת כלים ו־MCP דרך ספריית ייעודית.

  • ניתוח מסמכי ענק

    מאפשר לטעון קוד מקור מלא או ספריות חוזים עד מיליון טוקנים בשרת מאובטח.

  • מענה טכני מיידי

    פותר בעיות לוגיקה ומתמטיקה מהר בלי להמתין לפלט של חשיבה איטית.

איפה זה נופל

הכרטיס מבהיר שהמודל לא תומך במצב חשיבה ולא מייצר בלוקים של מחשבה, מה שמשאיר אותו מאחור במשימות תכנות מסובכות כמו Aider-Polyglot שבו קיבל 57.3 נקודות, נמוך בהרבה ממתחרים ייעודיים. בנוסף, העלאת נוכחות מילים באמצעות presence_penalty מעל ערך מסוים גורמת לו לערבב שפות בצורה לא רצויה, דבר שפוגע במיוחד בטקסט שמשלב עברית ואנגלית.

אותה משפחה

Qwen3-235B-A22B-Instruct-2507 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על שרת יחיד עם כרטיס אחד?

לא. משקל המודל לבדו הוא 438 ג'יגה ב־129 קבצים, והוא דורש לפחות שמונה כרטיסי מסך מתקדמים עם חלוקת מודל כדי להיטען לזיכרון.

למה מקבלים שגיאת KeyError בהרצה הראשונה?

הארכיטקטורה חדשה ודורשת ספריית transformers מגרסה 4.51.0 ומעלה, אחרת הספרייה פשוט לא מזהה את סוג המודל ומפסיקה לפעול.

איך מונעים קריסות זיכרון בהקשרים ארוכים?

אם אין לכם אלף ג'יגה זיכרון וידאו, יש לקצר את אורך ההקשר בהגדרות ההפעלה ל־32,768 טוקנים או להשתמש בעיבוד מקוטע.

איך מריצים

כדי להעלות את 438 הג'יגה של המשקלים ב־bfloat16, תצטרכו שרת עם שמונה מאיצי GPU וחצי טרה זיכרון רק למשקלים. אם תרצו לנצל את מלוא ההקשר של מיליון טוקנים, תזדקקו לכאלף ג'יגה זיכרון וידאו עבור ה־KV cache והאקטיבציות. ההרצה דורשת ספריות עדכניות כמו vLLM 0.8.5 או SGLang 0.4.6 עם חלוקה של שמונה מאיצים במקביל.

לרוב הצוותים, להחזיק צבר חומרה של 1000GB VRAM בענן בשביל כמה שאילתות ביום זה בזבוז כסף מוחלט. עדיף לפנות ל־API חיצוני שמחזיק את המודל, אלא אם אתם מחויבים רגולטורית לשמור נתונים על שרתים פנימיים סגורים.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-235B-A22B-Instruct-2507")
print(pipe("שלום"))

הקבצים

129 קבצים במאגר, 438 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. אתם יכולים להשתמש בו מסחרית, לשנות אותו, להטמיע אותו במוצרים שלכם ואפילו למכור גישה אליו, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית והצהרת הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗