GPT
Q

Qwen3-30B-A3B-GPTQ-Int4

קוד פתוח

Qwenapache-2.02025-05-05

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

שילוב של ארכיטקטורת תערובת מומחים עם כימות לארבעה ביטים, שמאפשר להריץ מודל חשיבה ושיחה של 30 מיליארד פרמטרים על כרטיס מסך בודד.

  • 31Bפרמטרים
  • 40,960טוקנים בהקשר
  • 15.8 GBמשקל הקבצים
  • 395,827הורדות בחודש

מה זה

הגרסה הזו דוחסת 30.5 מיליארד פרמטרים כוללים לתוך 15.8 גיגה בייט, כאשר בפועל פועלים רק 3.3 מיליארד פרמטרים בכל טוקן מתוך שמונה מומחים פעילים. המבנה הזה מספק מהירות חישוב של מודל קטן עם מאגר הידע של מודל גדול, כולל יכולת מובנית לכבות ולהדליק שרשרת חשיבה מלאה לפי צורך.

המספרים במבחנים מראים ירידה מתונה יחסית מגרסת המקור. במצב חשיבה המודל יורד מציון 74.3 ל־71.5 ב־LiveBench ומ־80.4 ל־79.5 ב־AIME24, מה שאומר שהכימות כמעט לא פגע ביכולות המתמטיקה וההיגיון הכבד, אבל במבחני ידע כללי כמו GPQA מורגשת ירידה מ־65.8 ל־60.1 נקודות.

מתאים ל

  • פתרון בעיות מתמטיקה וקוד

    מצב החשיבה שומר על ציון 79.5 ב־AIME24 גם תחת כימות, ומתאים למשימות לוגיות קשות.

  • סוכני אוטונומיה מבוססי כלים

    הארכיטקטורה תומכת בהפעלת פונקציות חיצוניות ובחיבור לתצורות MCP ללא צורך בהנדסת פרומפטים מורכבת.

  • שירות לקוחות רב־לשוני

    כיבוי מצב החשיבה מוריד זמני תגובה ומאפשר שיחה שוטפת בלמעלה ממאה שפות על חומרה צנועה.

איפה זה נופל

הכימות מביא איתו נטייה ברורה לחזרות בלתי נגמרות על טקסט, במיוחד במצב חשיבה. חובה להגדיר presence_penalty בעוצמה של 1.5 כדי לייצב אותו, אבל המפתחים מציינים שהערך הזה עלול להוביל לערבוב שפות באמצע תשובה. אסור לחלוטין להשתמש בפיענוח חמדן (greedy decoding), והפעלת YaRN באופן סטטי על טקסטים קצרים פוגעת באיכות התוצאות.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל דורש גרסת transformers ספציפית?

כן, חובה להשתמש בגרסה 4.51.0 ומעלה של הספרייה. גרסאות ישנות יותר זורקות שגיאת מפתח על ארכיטקטורת qwen3_moe ולא מזהות את השכבות של המודל.

איך מבטלים את פלט החשיבה כדי לקבל תשובות מהירות?

מגדירים את הפרמטר enable_thinking כערך שקר בתבנית השיחה, או שולחים את התג no_think בהודעת המשתמש. במצב הזה המודל מדלג על שלב הניתוח ומחזיר ישירות את התשובה הסופית ללא בלוק הייעודי.

איך מריצים

המשקל הכולל יושב על 15.8 גיגה בייט, כך שכרטיס מסך בודד של 24 גיגה בייט כמו RTX 3090 או RTX 4090 יחזיק אותו בכיף יחד עם הקשר עבודה בסיסי. ההרצה נעשית ישירות דרך מנועים מודרניים כמו vLLM 0.8.4 או SGLang מגרסה 0.4.6 ומעלה, שמכירים את ארכיטקטורת המומחים החדשה.

אם אתם צריכים לפתוח את ההקשר מעבר ל־32 אלף טוקנים לכיוון 131 אלף בעזרת YaRN, או משרתים עשרות פניות במקביל, כרטיס בודד ייחנק מהר מאוד בגלל זיכרון ה־KV. במצב כזה עדיף לשלם לפי טוקן ב־API מנוהל כמו Alibaba Model Studio מאשר להשקיע בשרת מרובה כרטיסים.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-30B-A3B-GPTQ-Int4")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים והפצה בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים המקורית והפצת עותק של הרישיון לצד התוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗