GPT
Q

Qwen3-235B-A22B-Instruct-2507-FP8

קוד פתוח

Qwenapache-2.02025-07-21

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת MoE ענקית שפועלת בלי בלוקים של חשיבה ומפעילה רק 22 מיליארד פרמטרים בכל טוקן. מקבלים ביצועי קצה במתמטיקה ובקוד עם חלון של 256 אלף טוקנים ישירות מהקופסה.

  • 235Bפרמטרים
  • 262,144טוקנים בהקשר
  • 220 GBמשקל הקבצים
  • 256,145הורדות בחודש

מה זה

מדובר במודל MoE עם 235 מיליארד פרמטרים בסך הכול, אבל רק 22 מיליארד מתוכם פעילים לכל טוקן דרך ניתוב לשמונה מומחים מתוך 128. הוא מגיע מכויל מראש בדיוק FP8 עם חלוקה לבלוקים של 128, ומיועד למענה ישיר בלי לפלוט תגיות חשיבה. הגרסה הזו מציגה קפיצה ניכרת ביחס לגרסה הרגילה מאותה סדרה, במיוחד במשימות שדורשות לוגיקה נוקשה.

במבחני הביצועים הוא עוקף את המתחרים הגדולים בחלק ניכר מהמקרים. הוא רושם 70.3 ב־AIME25 ו־51.8 ב־LiveCodeBench, תוצאות שמשאירות מאחור מודלים כמו GPT-4o ו־Deepseek-V3 בגרסאות שנבדקו. גם בשימוש בכלים הוא מגיע ל־70.9 ב־BFCL-v3, מה שהופך אותו למועמד רציני לפיתוח סוכנים אוטומטיים שמריצים קוד וקוראים לפונקציות חיצוניות.

מתאים ל

  • פתרון בעיות מתמטיקה ומדע

    התוצאה של 70.3 ב־AIME25 מאפשרת עיבוד שאלות הנדסיות ומדעיות סבוכות ללא צורך בהמתנה לפלט חשיבה ארוך.

  • סוכן להרצת פונקציות וקוד

    שילוב של ציון 51.8 ב־LiveCodeBench יחד עם תמיכה מובנית בחיבור כלים מתאים לאוטומציות פיתוח מורכבות.

  • ניתוח מסמכים ארוכים

    תמיכה מובנית בעד 256 אלף טוקנים ללא הרחבות חיצוניות מאפשרת להזין קבצי קוד ענקיים או חוזים שלמים בבת אחת.

איפה זה נופל

החולשה העיקרית מופיעה בתרחישי סוכנים ספציפיים, כמו בדיקת TAU2-Telecom שבה הוא קיבל רק 32.5 נקודות, נמוך בהרבה ממתחרים כמו Kimi K2. בנוסף, כשמנסים לפתור חזרתיות באמצעות נוהל נוקשה של קנס נוכחות, המודל נוטה לערבב שפות ומאבד דיוק בתשובות. מעבר לזה, מנגנון ה־FP8 הייחודי סובל מבעיות יציבות בהסקה מבוזרת תחת ספריות מסוימות, כך שאי אפשר לזרוק אותו ישר לפרודקשן בלי בדיקות עומס מקדימות.

אותה משפחה

Qwen3-235B-A22B-Instruct-2507 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם צריך להגדיר פרמטרים מיוחדים כדי לכבות את מנגנון החשיבה?

לא. הדגם הזה אומן מראש לפעול במצב ישיר בלבד, הוא לא כולל בלוקים של חשיבה בפלט, ואין צורך להעביר דגל שמבטל אותם.

איך אפשר למנוע שגיאות זיכרון בהרצה מקומית?

אם מגיעים למגבלת הזיכרון בכרטיסים, ההמלצה הישירה של המפתחים היא להקטין את גודל ההקשר המקסימלי מ־256 אלף טוקנים לרמה של 32,768 טוקנים בהגדרות השרת.

האם המודל ירוץ על כל גרסה של Hugging Face transformers?

לא. חובה לעבוד עם גרסה 4.51.0 ומעלה, אחרת הספרייה לא תזהה את הארכיטקטורה ותזרוק שגיאת מפתח על מבנה ה־MoE.

איך מריצים

כדי להריץ קבצים ששוקלים 220 גיגה בייט צריך שרת רציני עם כמה מאיצים גרפיים. הדוגמאות של המפתחים מציגות פריסה עם vLLM או SGLang בחלוקה לרוחב ארבעה כרטיסים, אבל אם תרצו לנצל את מלוא ההקשר שמגיע ל־262,144 טוקנים, זיכרון ה־VRAM ייגמר מהר מאוד ותצטרכו לקצץ אותו לאזור 32 אלף.

אם אין לכם אשכול ייעודי של כרטיסים מודרניים עם תמיכה טבעית ב־FP8, עדיף לחבר את המערכת ל־API מנוהל. הרצה עצמית ב־transformers דורשת גרסה 4.51.0 ומעלה, ובמערך מרובה כרטיסים יש באג מוכר שמחייב הגדרה של משתנה סביבה כדי למנוע קריסות.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-235B-A22B-Instruct-2507-FP8")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר לקחת את המשקלים, לשנות אותם, לשלב אותם במוצר מסחרי סגור ולמכור גישה אליו בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והטקסט של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗