GPT
Q

Qwen3-32B-AWQ

קוד פתוח

Qwenapache-2.02025-05-01

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת 4 ביט של מודל 33 מיליארד פרמטרים, שמאפשרת להריץ יכולות חשיבה ושיחה חופשית על כרטיס מסך בודד של 24 גיגה בלי לשבור את הראש.

  • 33Bפרמטרים
  • 40,960טוקנים בהקשר
  • 18.0 GBמשקל הקבצים
  • 704,476הורדות בחודש

מה זה

מדובר במודל שפת בסיס ושיחה שמגיע מכווץ בשיטת AWQ, מה שמוריד את המשקל הכולל ל־18 גיגה. החידוש העיקרי כאן הוא מתג מובנה בין מצב חשיבה עמוקה לפתרון בעיות מורכבות במתמטיקה וקוד, לבין מצב שיחה רגיל ומהיר. אפשר לשלוט במעבר הזה פר פנייה דרך הטמפלייט או ישירות בטקסט של המשתמש בעזרת פקודות פשוטות.

מבחינת ביצועים, הכיווץ ל־4 ביט כמעט לא פוגע ביכולות לעומת גרסת הדיוק המלאה. במבחן AIME24 למשל, גרסת ה־AWQ מוציאה ציון 79.4 במצב חשיבה לעומת 81.4 ב־bf16, וב־GPQA היא אפילו עוקפת מעט עם 69 לעומת 68.4. במצב ללא חשיבה הציונים צונחים משמעותית, למשל 59.8 ב־LiveBench לעומת 73.1 במצב חושב, מה שמראה בבירור מתי שווה לשלם בזמן ריצה ומתי לא.

מתאים ל

  • פתרון בעיות קוד ואלגוריתמים

    מצב החשיבה מוציא תוצאות קרובות למודלים ענקיים ונכנס ישירות לכרטיס מסך צרכני בלי לפשוט רגל.

  • סוכן אוטונומי להפעלת כלים

    המערך תומך בהפעלת כלים חיצוניים וקריאות פונקציה מובנות דרך Qwen-Agent בשני מצבי העבודה.

  • בוט שיחה וסיעור מוחות מהיר

    כיבוי מצב החשיבה מייצר מענה זריז וחסכוני במשאבים שמתאים לדיאלוג שוטף שלא דורש חישוב עמוק.

איפה זה נופל

הגרסה המכווצת סובלת מנטייה לחזרות אינסופיות של טקסט, במיוחד אם מנסים לעבוד עם דגימה חמדנית שאסורה כאן לחלוטין. כדי למנוע את הלולאות האלה צריך להגדיר עונש נוכחות ברמה של 1.5, אבל ערך כזה גורר לפעמים ערבוב שפות מוזר באמצע התשובה וירידה מסוימת באיכות. בנוסף, אם מרחיבים את ההקשר בעזרת מנגנון YaRN הסטטי, הביצועים על טקסטים קצרים עלולים להיפגע, כך שלא כדאי להפעיל אותו סתם אם לא חייבים הקשר ארוך באמת.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

אפשר להריץ אותו עם הגדרות טמפרטורה רגילות?

עדיף שלא. במצב חשיבה חובה להשתמש בטמפרטורה 0.6 ואסור להפעיל דגימה חמדנית כי המודל ייכנס ללולאות בלתי נגמרות. במצב שיחה רגיל ההמלצה היא לעלות ל־0.7, ולשמור על TopP ו־TopK לפי ההנחיות.

כמה טקסט אפשר להכניס אליו בפועל?

הוא מגיע עם תמיכה טבעית של כ־32 אלף טוקנים, כאשר הקונפיגורציה מקצה עד 40,960 טוקנים לחישוב כולל. אם מגדירים RoPE scaling עם YaRN אפשר למתוח אותו עד 131,072 טוקנים, אך זה פוגע באיכות הניתוח של טקסטים קצרים.

האם חייבים להעביר לו את כל היסטוריית החשיבה בצ'אט רב־שלבי?

ממש לא, ואפילו מומלץ שלא לעשות את זה. בהיסטוריית השיחה צריך להשאיר רק את התשובה הסופית שנפלטה ולחתוך את בלוק ה־think, אחרת איכות ההמשך תיפגע והקשר יתמלא בטוקנים מיותרים.

איך מריצים

כדי להריץ אותו מקומית צריך כרטיס מסך אחד עם לפחות 24 גיגה זיכרון וידאו, מה שהופך כרטיסים כמו RTX 3090 או 4090 לאופציה מעשית. ההרצה עובדת חלק דרך vLLM מגרסה 0.8.5 או SGLang מגרסה 0.4.6 ומעלה, כשחשוב לוודא שחבילת transformers מעודכנת לפחות ל־4.51.0 אחרת תקבלו שגיאת זיהוי ארכיטקטורה.

אם אתם צריכים רק שיחות קצרות ומעט שליפות, כרטיס מקומי יעשה את העבודה בזול. ברגע שהעומס עולה וצריך לשרת משתמשים רבים במקביל, או להרחיב את חלון ההקשר מעבר ל־32 אלף טוקנים בעזרת YaRN, עדיף לפנות ל־API ייעודי כדי לא להסתבך עם ניהול זיכרון מורכב.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-32B-AWQ")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0, שזה בדיוק מה שרוצים לראות. מותר להשתמש במודל לצרכים מסחריים חופשי, לשנות אותו, להטמיע אותו במוצרים פנימיים או למכור שירותים שמבוססים עליו, בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים והרישיון המקורי בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗