GPT
Q

Qwen3-30B-A3B

קוד פתוח

Qwenapache-2.02025-04-27

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

ארכיטקטורת מומחים שמפעילה רק 3.3 מיליארד פרמטרים בכל טוקן מתוך 30.5 מיליארד בסך הכל. שילוב שנותן מהירות של מודל קטן עם עומק מחשבה של מודל גדול בהרבה.

  • 31Bפרמטרים
  • 40,960טוקנים בהקשר
  • 56.9 GBמשקל הקבצים
  • 2,097,577הורדות בחודש

מה זה

מדובר במודל MoE עם 128 מומחים שמפעיל 8 מתוכם לכל טוקן. המבנה הזה מחזיק 30.5 מיליארד פרמטרים בזיכרון, אבל בפועל החישוב בזמן ריצה שווה ערך למודל של 3.3 מיליארד פרמטרים בלבד. הוא תומך בהפעלת מצב חשיבה עמוק עם תגיות ייעודיות לצורך פתרון בעיות מורכבות במתמטיקה וקוד, לצד אפשרות לכבות את המנגנון הזה לחלוטין לקבלת מענה ישיר ומהיר בשיחות רגילות.

ההקשר הטבעי עומד על 32,768 טוקנים וניתן להרחבה עד 131,072 טוקנים באמצעות YaRN. היכולת להחליף בין מצב מחשבה לרגיל בתוך אותו מודל, כולל מעבר דינמי באמצעות פקודות בשיחה, חוסכת תחזוקה של שני מודלים נפרדים למשימות שונות.

מתאים ל

  • סוכני תוכנה וקריאות לכלים

    מבנה מומחים מהיר שמשלב אינטגרציה מדויקת עם כלים חיצוניים במצב חשיבה או במענה ישיר.

  • פתרון בעיות קוד ומתמטיקה

    יכולת הפעלת מצב חשיבה מעמיק שמייצר שלבי פתרון מפורטים לפני הפלט הסופי.

  • שירות לקוחות רב לשוני

    כיבוי מצב החשיבה מאפשר מענה מהיר בשיחה מרובת סבבים בתמיכה בלמעלה מ־100 שפות.

איפה זה נופל

אסור להשתמש בחיפוש חמדני (greedy decoding) בזמן שמצב החשיבה פועל, כי הוא גורם לנפילה בביצועים וללולאות טקסט אינסופיות. כדי לקבל יציבות צריך להגדיר טמפרטורה מדויקת של 0.6 ומדדי דגימה ספציפיים. הרחבת ההקשר מעבר לטווח הטבעי בעזרת YaRN סטטי עלולה לפגוע בדיוק הטקסטים הקצרים, והעלאת מדד ה־presence penalty כדי למנוע חזרות גורמת לעיתים לערבוב שפות.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך שולטים במצב החשיבה בזמן שיחה?

אפשר להגדיר מראש בפרמטרים את כיבוי המצב כדי לחסוך זמן ומשאבים. אם המצב פעיל, ניתן לשלוח הודעה שכוללת no_think כדי לדלג על שלב המחשבה בתור הנוכחי, או think כדי להחזיר אותו.

למה המודל דורש כל כך הרבה זיכרון אם הוא מפעיל מעט פרמטרים?

ארכיטקטורת MoE מחייבת לטעון את כל 30.5 מיליארד הפרמטרים לזיכרון ה־VRAM כדי שהמומחים יהיו זמינים מיידית. החיסכון מתבטא בכוח העיבוד של המעבד הגרפי בכל טוקן, לא בנפח הזיכרון הנדרש להחזקת המשקלים.

איך מריצים

המשקל הכולל של הקבצים בפורמט bfloat16 מגיע ל־56.9 גיגה בייט, כך שתצטרכו שרת עם לפחות 64 עד 80 גיגה בייט זיכרון וידאו, כמו כרטיס A100 או H100 בודד, רק כדי לטעון אותו ללא קוונטיזציה. אפשר לפרוס אותו מקומית או בשרת פרטי באמצעות vLLM, SGLang, transformers מגרסה 4.51.0 ומעלה, או llama.cpp.

אם אין לכם חומרה כזו זמינה, דרישות הזיכרון הגבוהות הופכות את ההרצה העצמית ליקרה, במיוחד כשרק חלק קטן מהפרמטרים פעיל בכל רגע. במצב כזה, פנייה לנקודת קצה מנוהלת תהיה זולה ופשוטה משמעותית מתחזוקת תשתית עצמאית.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-30B-A3B")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה חופשית. מותר לשלב אותו במוצרים פנימיים או מסחריים בלי לחשוף קוד מקור, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗