GPT
Q

Qwen3-32B

קוד פתוח

Qwenapache-2.02025-04-27

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל פתוח במשקל 33 מיליארד פרמטרים שמחליף בין מצב חשיבה עמוקה לשיחה מהירה. הוא מציע יכולות הסקה מתקדמות וחיבור לכלים בלי להחזיק שרת ענק.

  • 33Bפרמטרים
  • 40,960טוקנים בהקשר
  • 61.0 GBמשקל הקבצים
  • 5,156,288הורדות בחודש

מה זה

הארכיטקטורה מבוססת על 64 שכבות ומשלבת בתוכה שני מצבי עבודה שונים לחלוטין. במצב ברירת המחדל הוא מייצר בלוק חשיבה מפורט לפתרון בעיות היגיון, מתמטיקה וקוד, ובכיבוי המצב הזה הוא מגיב ישירות כמו מודל שיחה רגיל ומהיר. הוא כולל תמיכה מובנית ביותר ממאה שפות ומיועד לתפקד כסוכן שיודע להפעיל כלים חיצוניים.

ההבדל המרכזי מול מה שהיה מקובל בגודל הזה הוא האיחוד בין מודל חשיבה למודל שיחה באותו קובץ משקלים. במקום להריץ מודל ייעודי להסקה לוגית ובמקביל מודל נפרד לפקודות שוטפות, מנהלים את ההתנהגות הזו באמצעות דגל בהגדרות הטוקנייזר או פקודות בטקסט עצמו. הוא מתוכנן לתת ביצועי הסקה טובים יותר מסדרות קודמות בלי לדרוש שרשור מודלים חיצוני.

מתאים ל

  • סוכן להרצת פקודות וכלים

    מבצע קריאות לכלים חיצוניים ושומר על תבניות פנייה מוגדרות בשני מצבי העבודה.

  • פתרון בעיות קוד מורכבות

    מצב החשיבה מפרק בעיות אלגוריתמיות לשלבים לפני החזרת קטע הקוד הסופי.

  • צ'אט מהיר ומרובה שפות

    כיבוי מצב החשיבה מאפשר מענה ישיר וחוסך זמן עיבוד יקר בשיחות רגילות.

איפה זה נופל

אסור להשתמש בפענוח מסוג greedy decoding במצב החשיבה, כי הוא גורם לנפילה בביצועים וללולאות טקסט אינסופיות. אם תעלו את מקדם הענישה על חזרתיות כדי לעצור את הלולאות האלו, המודל עלול לערבב שפות שונות באותה תשובה. בנוסף, הרחבת ההקשר עד 131,072 טוקנים דורשת הפעלת מנגנון סטטי שפוגע באיכות התוצאות על טקסטים קצרים, ושרשור היסטוריית השיחה מחייב ניקוי ידני של בלוקי החשיבה הקודמים כדי לא לשבור את המעקב.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מבטלים את זמן ההמתנה של החשיבה כשרק רוצים תשובה מהירה?

מעבירים את הפרמטר enable_thinking=False בעת יצירת הפרומפט בטוקנייזר או שולחים no_think בטקסט. המודל יפסיק להוציא את בלוק החשיבה ויגיב מיד.

אפשר להזין לו מסמכים של מאה אלף טוקנים בלי לשנות הגדרות?

לא. באופן טבעי המודל מוגבל להקשר קצר יותר, וכדי להגיע לטווח של 131,072 טוקנים צריך להפעיל תצורת YaRN ייעודית בהרצה.

האם צריך לשמור את כל בלוק החשיבה כשהמשתמש ממשיך לשאול שאלות?

לא, ההנחיה היא לנקות את תגי החשיבה מההיסטוריה ולהשאיר רק את התשובה הסופית. השארת שלבי הביניים בהיסטוריית השיחה עלולה לבלבל את המודל ולפגוע באיכות המענה בהמשך.

איך מריצים

המשקלים תופסים 61 גיגה בייט בפורמט המקורי, מה שאומר שצריך לפחות 80 גיגה בייט של זיכרון גרפי, למשל כרטיס A100 או H100 בודד, כדי לטעון אותו ללא קוונטיזציה. מקומי אפשר להריץ אותו דרך ספריות כמו vLLM, SGLang, Ollama או llama.cpp, כאשר סביבות פריסה דורשות גרסת transformers עדכנית החל מ־4.51.0 כדי לתמוך בארכיטקטורה.

אם אין לכם חומרה כזו ייעודית, עדיף לפנות לנקודת קצה שמגישה אותו כשירות. מעבר לעלות השרת, פריסה כזו חוסכת את ההתעסקות בהגדרת הרחבת ההקשר מעבר ל־32,768 טוקנים באמצעות YaRN, שמחייבת כיוונון ידני בפרמטרים של השרת.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-32B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים ולהפיץ מוצר שמבוסס עליו, כל עוד שומרים על הודעות זכויות היוצרים וכתב הוויתור על האחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗