GPT
Q

Qwen3-30B-A3B-Instruct-2507

קוד פתוח

Qwenapache-2.02025-07-28

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

זה מודל תערובת מומחים עם 30.5 מיליארד פרמטרים שמפעיל רק 3.3 מיליארד בכל טוקן. הוא נותן מהירות תגובה גבוהה ותמיכה מובנית בטקסטים ארוכים בלי שרשראות חשיבה מנופחות.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 56.9 GBמשקל הקבצים
  • 1,161,599הורדות בחודש

מה זה

המודל פועל כמודל הוראות ישיר בארכיטקטורת תערובת מומחים. מתוך 128 מומחים קיימים, הוא מנתב כל טוקן לשמונה בלבד. המבנה הזה מאפשר לו לעבד הקשר מקורי של 262,144 טוקנים, עם אופציה להרחבה עד למיליון טוקנים באמצעות מנגנוני תשומת לב מיוחדים כמו Dual Chunk Attention ו־MInference.

במבחני ביצועים הוא מציג זינוק חד לעומת גרסאות קודמות בגודל הזה. במבחן ZebraLogic הוא מגיע לציון 90 לעומת 33.2 בגרסה הקודמת, ובמבחן LiveCodeBench הוא עומד על 43.2 נקודות לעומת 29. במספר מדדים, כמו כתיבה וקוד ב־MultiPL-E, הוא משתווה למודלים סגורים וגדולים ממנו בהרבה, ועדיין מחזיר תשובות מהירות בלי להדפיס תגיות חשיבה מקדימות.

מתאים ל

  • עיבוד מסמכים ארוכים

    תמיכה מובנית ב־256 אלף טוקנים מאפשרת ניתוח של חוזים וספרי קוד שלמים בלי לאבד את ההקשר.

  • עוזרי קוד ופיתוח

    תוצאה של 83.8 ב־MultiPL-E הופכת אותו לכלי מהיר ומדויק להשלמות קוד ויצירת פונקציות.

  • מערכות מענה מהיר

    הפעלה של 3.3 מיליארד פרמטרים בלבד בכל שלב מספקת זמני תגובה נמוכים מאוד בשירות לקוחות.

איפה זה נופל

למרות ההתקדמות בלוגיקה, המודל מתקשה במשימות סוכנים רב שלביות בתחומים מוגדרים. במבחן TAU2-Telecom הוא צונח לציון 12.3 בלבד, וב־Aider-Polyglot הוא משיג 35.6 נקודות, נמוך בהרבה מגרסאות ענק. מעבר לזה, ניסיון להפחית חזרתיות בעזרת ערכי presence penalty גבוהים עלול לגרום למודל לערבב בין שפות ולפגוע באיכות הפלט.

אותה משפחה

Qwen3-30B-A3B-Instruct-2507 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בהצגת תהליך חשיבה פנימי?

לא. גרסה זו תוכננה לעבוד אך ורק במצב ללא חשיבה. היא לא מייצרת בלוקים מסוג think ומחזירה את התשובה הסופית ישירות, כך שאין צורך להגדיר דגלים לביטול חשיבה בקוד שלכם.

למה מופיעה שגיאת KeyError של qwen3_moe בזמן הטעינה?

השגיאה נובעת מגרסה ישנה של ספריית transformers שלא מכירה את הארכיטקטורה החדשה. עליכם לשדרג את הספרייה לגרסה 4.51.0 ומעלה כדי שהמודל ייטען בצורה תקינה.

איך מריצים

המשקל הכולל של הקבצים בפורמט bfloat16 עומד על 56.9 גיגה בייט. להרצה בסיסית של המודל תצטרכו שרת עם לפחות כרטיס אחד של 80 גיגה בייט כמו A100 או H100, או שני כרטיסי 48 גיגה בייט. תמיכה מקומית קיימת בכלים כמו vLLM, SGLang, Ollama ו־llama.cpp, אך חובה לוודא שגרסת ה־transformers שלכם היא 4.51.0 ומעלה כדי שהארכיטקטורה תזוהה.

אם אתם מתכננים לנצל את מלוא ההקשר של מיליון טוקנים, דרישות החומרה קופצות בחדות. הדף הרשמי מציין צורך בכ־240 גיגה בייט של זיכרון כרטיסי מסך, מערך של ארבעה מעבדים גרפיים במקביל והגבלת המערכת לרצף בודד בכל פעם. לשימוש כזה בייצור, קריאה ל־API חיצוני תהיה זולה ופשוטה משמעותית מתחזוקת תשתית כבדה כל כך.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-30B-A3B-Instruct-2507")
print(pipe("שלום"))

הרישיון

המודל משוחרר ברישיון apache-2.0 מלא. אתם רשאים להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו במוצרים פנימיים או חיצוניים, בתנאי שתשמרו על הקרדיט והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗