GPT
Q

Qwen3-235B-A22B

קוד פתוח

Qwenapache-2.02025-04-27

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

ארכיטקטורת מומחים עם 235 מיליארד פרמטרים שמפעילה רק 22 מיליארד בכל שלב. הוא מאפשר לעבור בין מצב חשיבה מעמיק למענה מהיר ורגיל באותו מודל בדיוק.

  • 235Bפרמטרים
  • 40,960טוקנים בהקשר
  • 438 GBמשקל הקבצים
  • 330,184הורדות בחודש

מה זה

בבסיס שלו נמצאים 128 מומחים נפרדים, אבל המערכת דוגמת רק 8 מהם בכל טוקן. זה נותן קיבולת ידע של רשת ענקית יחד עם חישוב של מודל קטן בהרבה. החידוש העיקרי הוא מתג מובנה בין חשיבה עם שרשרת היסק ארוכה לבין תשובות ישירות, בלי להחליף משקלים או לטעון מודל נפרד.

הוא מיועד למשימות קוד, מתמטיקה, הפעלת סוכנים וקריאה לכלים חיצוניים דרך תבניות ייעודיות. התמיכה בשפות כוללת מעל 100 שפות וניבים, והוא מחזיק בהקשר מקורי של 32,768 טוקנים שניתן להרחבה עד 131,072 בעזרת מנגנון ייעודי.

מתאים ל

  • סוכנים אוטונומיים

    מפעיל כלים חיצוניים במדויק ומבצע לוגיקה מורכבת במצב חשיבה.

  • פתרון בעיות תכנות

    מאפשר פלט ארוך מאוד של עשרות אלפי טוקנים לחישובים מעמיקים.

  • שירות לקוחות מרובה שפות

    תומך במעל 100 שפות ומאפשר מענה מהיר כשמכבים את מצב החשיבה.

איפה זה נופל

אסור להשתמש בפיענוח חמדני במצב חשיבה, כי הוא גורם לירידה בביצועים וללולאות טקסט אינסופיות. כדי לעצור חזרות אפשר להעלות ענישה על נוכחות, אבל זה עלול לגרום לערבוב שפות ולפגוע באיכות הפלט.

בנוסף, הרחבת ההקשר מעבר ל־32,768 טוקנים משתמשת בסקיילינג סטטי שמוריד את איכות הפלט בטקסטים קצרים. אם השיחות שלכם קצרות, הפעלת ההרחבה הזו תפגע בתוצאות במקום לשפר אותן.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך עוברים בין מצב חשיבה מעמיק למענה מהיר?

מגדירים את הפרמטר הרלוונטי בתבנית השיחה ל־True או False. אפשר גם להוסיף את התגיות ישירות בהודעות המשתמש כדי לשנות את ההתנהגות ממהלך למהלך.

האם כדאי להפעיל תמיכה בטקסטים ארוכים מעבר ל־32K?

רק אם אתם באמת צריכים את זה. ההרחבה משתמשת במקדם קבוע שפוגע בביצועים של טקסטים קצרים, ולכן עדיף להשאיר את הגדרת ברירת המחדל אם הנתונים שלכם לא חורגים ממנה.

איך מריצים

כדי להעלות 438 גיגה בייט של קבצים בפורמט bfloat16, צריך שרת עם לפחות 8 כרטיסי מסך חזקים במקביל. אפשר להריץ אותו דרך vLLM או SGLang עם חלוקת טנזורים של 8, או מקומית דרך כלים כמו llama.cpp ו־Ollama אם יש לכם מספיק זיכרון.

אם אין לכם אשכול שרתים ייעודי שרץ סביב השעון, העלות של החומרה הנדרשת הופכת את ההרצה העצמית לחסרת היגיון. במצב כזה עדיף לשלם לפי שימוש לספק שמציע גישה אליו דרך ממשק תואם.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-235B-A22B")
print(pipe("שלום"))

הקבצים

128 קבצים במאגר, 438 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. אתם יכולים להשתמש בו בחינם, לשלב אותו במוצרים מסחריים סגורים, לשנות את המשקלים או להריץ אותו בשרתים שלכם בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗