GPT
Q

Qwen3-235B-A22B-Thinking-2507-FP8

קוד פתוח

Qwenapache-2.02025-07-25

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

זה מודל חשיבה ענק בארכיטקטורת תערובת מומחים עם 235 מיליארד פרמטרים, שמפעיל רק 22 מיליארד בכל טוקן. הוא מיועד למי שרוצה ביצועי קוד ומתמטיקה ברמה של המודלים הסגורים המובילים בחומרה פנימית.

  • 235Bפרמטרים
  • 262,144טוקנים בהקשר
  • 220 GBמשקל הקבצים
  • 41,635הורדות בחודש

מה זה

מדובר בגרסת FP8 מכווצת של מודל קוד פתוח כבד, שכולל 128 מומחים ומשתמש בשמונה מהם בכל מעבר. המודל מאומן לעצור ולחשוב לפני שהוא פולט תשובה, ומגיע מובנה עם חלון הקשר עצום של 262,144 טוקנים. ההבדל המרכזי מול מתחרים בקטגוריה הוא היכולת להחזיק הקשר ארוך בלי קריסה באיכות ההסקה.

במדדי ביצועים הוא עוקף מודלים כמו OpenAI O3 ו־Deepseek-R1 בחלק ממשימות התכנות והמתמטיקה. הוא הגיע לציון 74.1 במבחן התכנות LiveCodeBench v6 וציון 92.3 ב־AIME25. המשמעות בשטח היא יכולת לפתור בעיות אלגוריתמיות מסובכות ולנתח בסיסי קוד גדולים, ולא רק לכתוב סקריפטים פשוטים.

מתאים ל

  • פתרון בעיות קוד קשות

    ניתוח באגים מורכבים בזכות ציון 74.1 ב־LiveCodeBench ויכולת הסקה ארוכה.

  • סוכנים אוטונומיים

    קריאה לפונקציות וכלים חיצוניים בעזרת תמיכה מובנית ב־MCP ודיוק גבוה בבנצ'מרק BFCL.

  • עיבוד מסמכים ענקיים

    ניתוח מעמיק של עשרות עמודים בבת אחת הודות לחלון הקשר ילידי של 256K טוקנים.

איפה זה נופל

המודל פועל אך ורק במצב חשיבה, בלי אפשרות לכבות את זה לתשובות מהירות, מה שמייצר זמני תגובה ראשונית איטיים מאוד. בכרטיס המודל מציינים שאם מעלים את ה־presence penalty כדי למנוע חזרות בלתי נגמרות, הוא עלול לערבב שפות ולסבול מירידה בדיוק. בנוסף, בשיחות מרובות שלבים חובה לחתוך ידנית את בלוק החשיבה מההיסטוריה כדי לא לפגוע באיכות התשובות הבאות. במשימות מסוימות בעולם האמיתי, כמו סימולציות שירות של חברות תעופה, הוא קיבל 46 נקודות ב־TAU1 מול מעל 50 אצל המתחרים.

אותה משפחה

Qwen3-235B-A22B-Thinking-2507 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לצ'אט מהיר באתר?

לא כדאי. המודל מוגדר לחשוב בכל פנייה ומייצר אלפי טוקנים של הסקה לפני הפלט הסופי, כך שזמן ההמתנה לתשובה קצרה יהיה ארוך ומיותר לחלוטין.

איך מונעים שגיאות זיכרון בריצה מקומית?

הכרטיס ממליץ לקצר את חלון ההקשר במקרה של חוסר זיכרון, אך להשאיר אותו מעל 131,072 טוקנים כדי לאפשר מקום לשרשרת החשיבה הארוכה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־220 גיגה־בייט, כך שאי אפשר להריץ אותו על שרת בודד פשוט. צריך מערך של ארבעה כרטיסי GPU חזקים לפחות בשביל הרצה עם sglang או vllm באמצעות tensor parallel של 4. יש צורך בגרסת transformers 4.51.0 ומעלה כדי שהארכיטקטורה תזוהה בלי שגיאות.

המפתחים ממליצים להקצות פלט של לפחות 32,768 טוקנים כדי לתת לו מקום לחשוב, ועד 81,920 טוקנים לחישובים מורכבים. אם אין לכם שרת ייעודי בעשרות אלפי דולרים או שאתם לא יכולים לספוג את עלויות הזיכרון של הקשר מלא, עדיף להשתמש ב־API מוכן.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-235B-A22B-Thinking-2507-FP8")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא ללא תשלום תמלוגים, שינוי של הקוד והפצה פנימית או חיצונית במוצרים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים ועותק של הרישיון המקורי בכל הפצה של הקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗