GPT
Q

Qwen3-14B-AWQ

קוד פתוח

Qwenapache-2.02025-05-01

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת בארבעה ביטים למודל עם 15 מיליארד פרמטרים. היא כוללת מעבר מובנה בין מצב חשיבה עמוק למענה מהיר, במשקל של פחות מעשרה גיגה-בייט.

  • 15Bפרמטרים
  • 40,960טוקנים בהקשר
  • 9.3 GBמשקל הקבצים
  • 2,303,431הורדות בחודש

מה זה

המודל הזה מציע שתי צורות עבודה באותו קובץ משקלים. מצב אחד מייצר שרשרת חשיבה מפורטת בתוך תגיות ייעודיות לפתרון בעיות היגיון, מתמטיקה ותכנות, ומצב שני מדלג על החשיבה לטובת תשובות מהירות בשיחה חופשית. המעבר ביניהם נעשה דרך פרמטר בקריאה או פקודת טקסט בפרומפט.

הקוונטיזציה ל־AWQ 4-bit חוסכת זיכרון עם פגיעה מינימלית בביצועים. במבחן AIME24 המודל המכווץ קיבל 77.0 לעומת 79.3 במקור, וב־LiveBench במצב חשיבה הוא יורד מ־71.3 ל־70.0. זה אומר שאתם מקבלים כמעט את אותה יכולת פתרון בעיות, אבל בחצי מדרישות החומרה.

מתאים ל

  • פתרון בעיות מתמטיקה וקוד

    מצב החשיבה מביא תוצאה של 77 ב־AIME24, מה שמתאים לניתוח בעיות לוגיות מורכבות על כרטיס מסך בודד.

  • הפעלת סוכנים אוטונומיים

    הארכיטקטורה מותאמת מראש לקריאות כלים חיצוניים ושילוב עם פרוטוקול MCP גם במצב חשיבה וגם במצב רגיל.

  • צ'אטבוט רב-לשוני מהיר

    כיבוי מצב החשיבה מייצר מענה מהיר בשיחות מרובות תורות על בסיס תמיכה רחבה בלמעלה ממאה שפות.

איפה זה נופל

במצב חשיבה אסור להשתמש ב־greedy decoding כי הוא גורם ללופים אינסופיים וירידה באיכות. יוצרי המודל ממליצים להעלות presence_penalty לערך של 1.5 כדי לעצור חזרות מיותרות, אבל מזהירים שזה יכול לגרום לערבוב בין שפות ולפגיעה קלה בביצועים. בנוסף, שימוש בטכניקת YaRN להרחבת ההקשר פוגע באיכות הטקסט בשיחות קצרות.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מבטלים את זמן החשיבה הארוך בתשובות פשוטות?

אפשר להגדיר בקריאה enable_thinking=False או להוסיף no_think/ לפרומפט. במצב הזה המודל מדלג על תגיות החשיבה ומתנהג כמו מודל שיחה רגיל.

האם המודל תומך בהקשר של 131,072 טוקנים מהקופסה?

האורך המובנה מוגבל ל־32,768 טוקנים. כדי להגיע ל־131,072 צריך להפעיל ידנית הרחבת YaRN בהגדרות השרת, אך היא אינה מומלצת לטקסטים קצרים בגלל ירידה באיכות.

איך מריצים

המשקלים תופסים 9.3 גיגה-בייט, כך שאפשר להריץ אותו בנוחות על כרטיס מסך בודד עם 16 גיגה-בייט זיכרון. נתמך רשמית ב־vLLM וב־SGLang שמאפשרים להרים שרת מקומי תואם תקן OpenAI, ודורש transformers מגרסה 4.51.0 ומעלה אחרת הוא יזרוק שגיאה על ארכיטקטורת המודל.

אם אתם צריכים רק שאילתות קצרות ופשוטות בלי הפעלת מנגנון ההיגיון, אולי עדיף להשתמש ב־API חיצוני. הרצה עצמית שווה את המאמץ כשיש צורך בשליטה מלאה על פרמטרי הדגימה, הרצת סוכנים או מניעת זליגת מידע.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-14B-AWQ")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי תשלום תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗