GPT
Q

Qwen3-14B

קוד פתוח

Qwenapache-2.02025-04-27

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל של 15 מיליארד פרמטרים שמשלב מצב חשיבה עמוקה ומצב שיחה מהיר באותו משקל. הוא מתאים למי שרוצה ביצועי היגיון וקוד גבוהים בלי להחזיק שני מודלים נפרדים בשרת.

  • 15Bפרמטרים
  • 40,960טוקנים בהקשר
  • 27.5 GBמשקל הקבצים
  • 1,703,411הורדות בחודש

מה זה

החידוש העיקרי כאן הוא היכולת לדלג בין מצב חשיבה למצב רגיל בלי להחליף מודל. במצב חשיבה הוא פולט בלוק של נימוקים לפני התשובה, בדומה למה שראינו במודלים ייעודיים למתמטיקה ותכנות, ובמצב רגיל הוא מגיב ישירות כמו מודל שיחה קלאסי מסדרת 2.5.

הוא מאומן על יותר ממאה שפות ומכוון לעבודה עם סוכנים וקריאות לכלים חיצוניים. בארכיטקטורה של 40 שכבות וקשב מסוג GQA, הוא תופס משבצת ביניים שבין המודלים הקטנים של 7 או 8 מיליארד פרמטרים למפלצות של 32 מיליארד ומעלה, ומציע חלון הקשר בסיסי של 32,768 טוקנים שאפשר להרחיב עד 131,072 באמצעות YaRN.

מתאים ל

  • פתרון בעיות קוד מורכבות

    מצב החשיבה נותן לו לתכנן אלגוריתמים ולנמק פתרונות לפני הפליטה, בלי צורך במודל ייעודי נפרד.

  • סוכנים אוטונומיים וכלים

    הוא תומך בהפעלת כלים חיצוניים בשני המצבים שלו ומתחבר ישירות לתבניות של Qwen-Agent.

  • בוט שיחה חסכוני

    כיבוי מצב החשיבה מחזיר תשובות ישירות ומהירות בלי לבזבז טוקנים על תהליך המחשבה הפנימי.

איפה זה נופל

אסור להשתמש בפיענוח חמדני (greedy decoding) במצב חשיבה, כי המודל נכנס ללולאות אינסופיות של חזרות ומאבד ביצועים. אם משתמשים בהרחבת הקשר YaRN, המימוש הסטטי שלה ברוב הספריות עלול לפגוע באיכות התשובות על טקסטים קצרים, ולכן לא כדאי להפעיל אותה כשלא חייבים.

בנוסף, אם מגדילים את עונש החזרות (presence penalty) כדי למנוע ממנו להיתקע, הוא עלול להתחיל לערבב שפות בתוך אותה תשובה. בשיחות מרובות שלבים חובה לנקות את היסטוריית החשיבה מהקלט הבא כדי לא להעמיס על ההקשר.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך שולטים במצב החשיבה בזמן ריצה?

אפשר להגדיר אותו גלובלית בעזרת enable_thinking בתבנית השיחה, או להעביר תגיות /think ו־/no_think ישירות בתוך הפרומפט כדי לשנות התנהגות בין הודעה להודעה. אם מכבים את המצב ברמת המנוע, התגיות בטקסט לא ישפיעו.

האם הוא יכול לקרוא מסמכים ארוכים מעבר ל־32 אלף טוקנים?

כן, הוא נבדק עד 131,072 טוקנים באמצעות הרחבת YaRN עם פקטור 4.0. עם זאת, עדיף להפעיל את ההגדרה הזו רק כשיש צורך אמיתי, כי המימוש הקיים עשוי לפגוע בדיוק במשימות קצרות.

איך מריצים

המשקלים שוקלים 27.5 גיגה בפורמט bfloat16, מה שאומר שכדי להריץ אותו בלי קוונטיזציה צריך כרטיס עם לפחות 32 גיגה זיכרון וידאו, או לחלק אותו על פני שני כרטיסים קטנים יותר. אם מכווצים אותו ל־4 ביט דרך llama.cpp או Ollama, אפשר להסתדר עם 12 עד 16 גיגה זיכרון.

לסביבת ייצור מומלץ להשתמש ב־vLLM מגרסה 0.8.5 או SGLang מגרסה 0.4.6 ומעלה, שכוללים מפענח מובנה לפלט החשיבה. שימו לב שחובה לעבוד עם ספריית transformers בגרסה 4.51.0 ומעלה, אחרת תקבלו שגיאה על שם הארכיטקטורה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-14B")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, להטמיע במוצרים סגורים ולהפיץ אותם בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗