GPT
Q

Qwen3-235B-A22B-FP8

קוד פתוח

Qwenapache-2.02025-04-28

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת מומחים שמפעילה 22 מיליארד פרמטרים בלבד מתוך 235 מיליארד בכל טוקן, ומגיעה מכווצת מראש בבלוקים של FP8. מתאימה למי שרוצה ביצועים של מודל ענק בלי עלויות חישוב מנופחות.

  • 235Bפרמטרים
  • 40,960טוקנים בהקשר
  • 223 GBמשקל הקבצים
  • 11,055הורדות בחודש

מה זה

מדובר בארכיטקטורת Mixture of Experts עם 128 מומחים שמתוכם 8 מופעלים בכל רגע נתון. המבנה הזה מחזיק 235 מיליארד פרמטרים בזיכרון, אבל כוח החישוב הדרוש לכל טוקן שקול למודל של 22 מיליארד פרמטרים. הכיווץ כאן נעשה בשיטת fine-grained FP8 עם בלוקים בגודל 128, ישירות מהיוצרים, כך שאין צורך להמיר משקלים ידנית מגרסת המקור.

המאפיין הבולט ביותר הוא מתג מחשבה מובנה שמאפשר להפעיל ולכבות שרשראות חשיבה ארוכות לפי פקודה. במצב חשיבה הוא מייצר בלוק של נימוקים מפורטים לפני התשובה הסופית, ובמצב רגיל הוא עונה מיד ובמהירות כמו מודל שיחה רגיל. המעבר בין המצבים עובד גם בתוך שיחה רב שלבית באמצעות פקודות טקסט פשוטות של think ו־no_think. בנוסף, חלון ההקשר מגיע ל־32,768 טוקנים באופן טבעי, עם יכולת הרחבה עד 131,072 טוקנים באמצעות YaRN.

מתאים ל

  • סוכנים אוטונומיים

    חיבור ישיר לכלים חיצוניים דרך תבניות ייעודיות, עם תמיכה בהפעלת כלי עבודה גם במצב חשיבה מעמיק.

  • פתרון בעיות מתמטיקה ותכנות

    מצב חשיבה מובנה שמאפשר ניתוח לוגי צעד אחר צעד והפקת קוד מורכב עם חלון פלט רחב.

  • בוט שיחה וסיכום כללי

    כיבוי מצב החשיבה מחזיר תגובות מהירות וקצרות בעלויות חישוב נמוכות של 22 מיליארד פרמטרים פעילים בלבד.

איפה זה נופל

אסור להשתמש בחיפוש חמדני (greedy decoding) בזמן שמצב החשיבה דולק, כי המודל נכנס לחזרות אינסופיות וירידה קשה באיכות. בנוסף, שימוש בערכי ענישה על חזרות (presence penalty) מעל אפס עלול לגרום למודל לערבב שפות באמצע התשובה.

הרחבת ההקשר ל־131 אלף טוקנים מתבצעת בעזרת YaRN סטטי בכל ספריות הקוד הפתוח, מה שפוגע באיכות התשובות על טקסטים קצרים כל עוד ההגדרה הזו פעילה. כמו כן, בשיחות מתמשכות חובה לנקות את שלבי החשיבה מההיסטוריה ולהשאיר רק את התשובות הסופיות, אחרת המודל מאבד ביצועים ומבזבז הקשר יקר.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך שולטים במצב החשיבה בזמן שיחה?

אפשר להגדיר את הפרמטר enable_thinking ברמת ה־API, או פשוט לכתוב think/ ו־no_think/ בהודעות המשתמש. המודל מתאים את עצמו להוראה האחרונה בכל סיבוב של השיחה.

כמה זיכרון GPU צריך כדי להרים אותו?

המשקלים בלבד דורשים 223 גיגה בייט בפורמט FP8. כדי להריץ הסקה יציבה עם זיכרון להקשר וטוקנים, תצטרכו שרת עם לפחות 4 עד 8 כרטיסי מסך של 80 גיגה בייט כל אחד.

האם כדאי להפעיל תמיד את הרחבת ההקשר עד 131 אלף טוקנים?

לא. מנועי הקוד הפתוח מפעילים YaRN סטטי שפוגע באיכות הניתוח על טקסטים קצרים, ולכן מומלץ להישאר בחלון המקורי של 32 אלף טוקנים כל עוד אין צורך ממשי בהקשר ארוך.

איך מריצים

המשקלים תופסים 223 גיגה בייט בזיכרון ה־VRAM, ולכן הרצה עצמית דורשת שרת ייעודי עם מספר כרטיסי מסך מקצועיים שמחוברים יחד. המודל רץ ישירות מעל מנועי הסקה כמו vLLM מגרסה 0.8.5 ומעלה או SGLang מגרסה 0.4.6.post1, שתומכים בפירוק בלוקי המחשבה וביצירת שרת תואם OpenAI.

אם אתם משתמשים בספריית transformers ישירות בהרצה מבוזרת, יש באג ידוע בשיטת הכיווץ הזו שמחייב הגדרה של משתנה הסביבה CUDA_LAUNCH_BLOCKING על 1 כדי למנוע קריסות. למי שאין אשכול של כרטיסי H100 או A100 זמין באופן קבוע, הקמה מקומית תהיה יקרה ומסורבלת, ובמצב כזה עדיף לגשת ל־API בענן דרך Alibaba Model Studio.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-235B-A22B-FP8")
print(pipe("שלום"))

הקבצים

58 קבצים במאגר, 223 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים פנימיים או למכור גישה אליו בלי תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים ועותק הרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗