GPT
Q

Qwen3-14B-FP8

קוד פתוח

Qwenapache-2.02025-04-28

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת FP8 מכווצת למודל חשיבה ושיחה עם 15 מיליארד פרמטרים. היא חוסכת זיכרון ומאפשרת מעבר יזום בין פלט מהיר להסבר לוגי מעמיק.

  • 15Bפרמטרים
  • 40,960טוקנים בהקשר
  • 15.2 GBמשקל הקבצים
  • 114,969הורדות בחודש

מה זה

המודל מביא 14.8 מיליארד פרמטרים בתצורת FP8 עם בלוקים בגודל 128, מה שמכווץ את המשקל הכולל ל־15.2 גיגה-בייט. השינוי המרכזי כאן הוא היכולת לדלג בין מצב חשיבה מעמיק, שפולט תגיות ייעודיות לפתרון בעיות מתמטיקה ותכנות, לבין מצב שיחה רגיל ומהיר. אפשר לשלוט בזה דרך הטמפלייט של הטוקנייזר או באמצעות פקודות בתוך הטקסט עצמו.

הוא מתוכנן לתמוך ביותר מ־100 שפות וכולל 40 שכבות עם ארכיטקטורת Grouped Query Attention. חלון ההקשר הטבעי עומד על 32,768 טוקנים, אך תומך בהרחבה עד 131,072 טוקנים באמצעות מנגנון YaRN. המעבר הזה בין חשיבה לפלט ישיר הופך אותו לגמיש בהרבה מגרסאות קודמות, בלי להחזיק שני מודלים נפרדים בזיכרון.

מתאים ל

  • סוכני אוטומציה וכלים

    שילוב עם ספריות כלים חיצוניות בזכות יכולות Agent מובנות גם תחת מצב חשיבה וגם בשיחה ישירה.

  • פתרון בעיות קוד ומתמטיקה

    מצב החשיבה מייצר לוגיקה מעמיקה שלב אחר שלב בתוך תגיות ייעודיות לפתרון אלגוריתמים מורכבים.

  • שרתי שיחה מקומיים

    גודל של 15 גיגה מאפשר להרים שירות צ'אט מהיר ואיכותי על גבי כרטיס צרכני יחיד ללא תלות ברשת.

איפה זה נופל

המודל דורש דגימה מוגדרת היטב. במצב חשיבה חל איסור להשתמש ב־greedy decoding, כי המודל נכנס ללולאות אינסופיות של חזרות ומאבד לחלוטין את איכות הפלט. יש באגים מדווחים בריצה מבוזרת תחת transformers על מספר כרטיסים בגלל ה־FP8, מה שמאלץ להגדיר חסימת סנכרון ב־CUDA. בנוסף, הפעלת YaRN סטטי להרחבת ההקשר מעבר ל־32 אלף טוקנים עלולה לפגוע בדיוק הטקסטים הקצרים שלכם.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

למה כדאי לקחת את גרסת FP8 במקום bfloat16?

גרסת ה־FP8 שוקלת 15.2 גיגה-בייט ונכנסת כולה לכרטיס מסך עם 24 גיגה-בייט זיכרון. בגרסת bfloat16 המודל היה דורש מעל 30 גיגה-בייט, מה שמחייב שני כרטיסים או חומרה יקרה בהרבה.

איך מבטלים את החשיבה הארוכה אם אני רוצה מענה מהיר?

אפשר להגדיר enable_thinking כערך שלילי בטמפלייט של הטוקנייזר, או פשוט לשלוח no_think בפרומפט. המודל יענה מיד בסגנון של סדרות instruct קודמות בלי לבזבז טוקנים על תהליך המחשבה.

איך מריצים

כדי להריץ את קובצי ה־FP8 תצטרכו כרטיס מסך יחיד עם 24 גיגה-בייט זיכרון כמו RTX 3090 או RTX 4090, שבו המודל נכנס בנוחות יחד עם זיכרון הקשר בסיסי. הוא נתמך ישירות ב־vLLM מגרסה 0.8.5 וב־SGLang מגרסה 0.4.6 ומעלה, לצד כלים מקומיים כמו Ollama ו־llama.cpp. חובה לשים לב שגרסת ספריית transformers שלכם היא לפחות 4.51.0, אחרת תקבלו שגיאה על ארכיטקטורה לא מזוהה.

במידה ואתם צריכים הקשר של 131 אלף טוקנים מלאים עם עומס משתמשים גבוה, כרטיס בודד לא יספיק ל־KV cache. במצב כזה עדיף לפנות ל־API מנוהל שתומך ב־YaRN דינמי, במקום להסתבך עם הגדרות חומרה מרובות.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-14B-FP8")
print(pipe("שלום"))

הרישיון

רישיון Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו במוצרים סגורים בלי תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗