GPT
Q

Qwen3-235B-A22B-Thinking-2507

קוד פתוח

Qwenapache-2.02025-07-25

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל מומחים ענק שמוקדש כולו לחשיבה ופתרון בעיות סבוכות. הוא מיועד למי שצריך ביצועים ברמה של מודלים סגורים מובילים במתמטיקה ובקוד, עם יכולת להריץ הכל עצמאית.

  • 235Bפרמטרים
  • 262,144טוקנים בהקשר
  • 438 GBמשקל הקבצים
  • 12,032הורדות בחודש

מה זה

מדובר בארכיטקטורת תערובת מומחים עם מאתיים שלושים וחמישה מיליארד פרמטרים, שמתוכם עשרים ושניים מיליארד פעילים בכל טוקן. המודל פועל רק במצב חשיבה, ללא אפשרות מענה ישיר. לפי המבחנים של היוצרים, הוא עוקף מודלים כמו Claude4 Opus Thinking במתמטיקה של AIME25 עם ציון של 92.3 לעומת 75.5, ומשיג 74.1 ב־LiveCodeBench לעומת 48.9 בלבד של אופוס.

הוא מציע חלון הקשר טבעי של 262,144 טוקנים, עם אופציה להרחבה למיליון טוקנים באמצעות שילוב של Dual Chunk Attention ודגימה דלילה. החוזק שלו הוא בשמירה על דיוק גבוה גם בקצוות של הטקסט הארוך, לצד אינטגרציה עמוקה להפעלת כלים וסוכנים עצמאיים.

מתאים ל

  • פתרון בעיות אלגוריתמיות

    משיג ציון 2134 במבחן CFEval ומתאים ליצירת קוד תחרותי ומורכב.

  • ניתוח מסמכי ענק

    תומך בטקסטים של מאות אלפי טוקנים ומאפשר שאילתות מורכבות על תיעוד רחב.

  • סוכנים מרובי כלים

    כולל תמיכה מובנית ב־Qwen-Agent ומערכי בדיקות ייעודיים להפעלת פונקציות.

איפה זה נופל

הוא תומך אך ורק במצב חשיבה ממושך. אי אפשר לקבל ממנו תשובה קצרה ומהירה לשאלה פשוטה, והוא תמיד ייצר שרשרת מחשבה לפני שיענה. בנוסף, המודל פגיע לחזרתיות בלולאות ארוכות, והיוצרים מציינים שאם מעלים את ה־presence penalty כדי לפתור את זה, המודל עלול לערבב שפות ולספוג ירידה קלה בביצועים. כמו כן, בבדיקות HLE הוא מקבל 18.2 נקודות בלבד, והוא אינו מולטימודלי.

אותה משפחה

Qwen3-235B-A22B-Thinking-2507 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר לבטל את מנגנון החשיבה כדי לקבל תשובות מהירות יותר?

לא. המודל תוכנן לעבוד רק במצב חשיבה, ותבנית השיחה מוסיפה את התגית הרלוונטית באופן אוטומטי.

למה הפלט מגיע בלי תגית think פותחת?

תבנית הצ'אט של המודל כוללת את התגית הפותחת כבר בפרומפט המערכת. לכן הפלט שתקבלו יציג רק את תגית הסגירה בסיום החשיבה.

איזו גרסת transformers נדרשת להרצה ישירה?

חובה להשתמש בגרסה 4.51.0 ומעלה. גרסאות ישנות יותר יזרקו שגיאת KeyError על ארכיטקטורת qwen3_moe.

איך מריצים

כדי להריץ את המפלצת הזו מקומית אתם צריכים מערך רציני של שמונה מעבדים גרפיים, כשהמשקל הבסיסי ב־bfloat16 דורש כמעט חצי טרה רק לקבצים. אם תרצו למצות את מלוא חלון ההקשר של מיליון טוקנים, תיעוד המודל מציין בפירוש דרישה של כאלף גיגה־בייט זיכרון וידאו כולל עבור משקלים, אקטיבציות ו־KV cache.

מריצים אותו בעיקר דרך vLLM או SGLang עם פיצול tensor-parallel של 8 ומפענח deepseek-r1 לחשיבה. אם אין לכם שרת ייעודי כזה בחצר או בענן פרטי, חבל על הזמן ועל החשמל, ועדיף לצרוך אותו דרך API ייעודי.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-235B-A22B-Thinking-2507")
print(pipe("שלום"))

הקבצים

129 קבצים במאגר, 438 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט משוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי קוד, והפצה ללא תמלוגים, בתנאי שמשאירים את הקרדיט ואת נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗