GPT
Q

Qwen3-4B-FP8

קוד פתוח

Qwenapache-2.02025-04-28

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת FP8 מכווצת של מודל 4B, שכוללת מצב חשיבה מובנה למשימות היגיון וקוד. שוקל פחות מחמישה גיגה־בייט ומספק יכולות של מודלים גדולים בהרבה ישירות על חומרה צנועה.

  • 4.4Bפרמטרים
  • 40,960טוקנים בהקשר
  • 4.8 GBמשקל הקבצים
  • 123,041הורדות בחודש

מה זה

מדובר במודל שפה קומפקטי שמביא יכולת מעניינת שלא רואים בדרך כלל בגדלים האלה: מעבר דינמי בין מצב שיחה רגיל לבין מצב חשיבה מעמיק שמייצר שרשרת היגיון מפורטת לפני התשובה. השליטה הזו מאפשרת לחסוך טוקנים וזמן במשימות פשוטות, ולהפעיל ניתוח כבד רק כשבאמת צריך לפתור באג בקוד או תרגיל מתמטי מורכב.

הוא מאומן מראש לתמוך בהפעלת כלים חיצוניים וקריאות פונקציה, כך שאפשר לחבר אותו בקלות לסוכנים עצמאיים. היכולת לתקשר במעל 100 שפות מתורגמת לתמיכה רחבה, וההקשר הטבעי עומד על 32,768 טוקנים, עם אפשרות מובנית להרחבה עד 131,072 טוקנים באמצעות YaRN בלי לאבד את הידיים והרגליים בטקסטים ארוכים.

מתאים ל

  • סוכן מקומי להרצת קוד

    חיבור ישיר לסביבת פיתוח מקומית לבדיקת תחביר והפעלת כלים, בלי תלות בחיבור רשת ובלי שליחת קוד החוצה.

  • עיבוד מסמכים ארוכים

    ניתוח סיכומים וקבצים גדולים באמצעות הרחבת חלון ההקשר עד 131,072 טוקנים על גבי שרת ארגוני פנימי.

  • בוט חכם למכשירים מוגבלים

    הרצה מקומית על מחשבי קצה עם זיכרון נמוך, תוך מעבר למצב חשיבה רק בשאלות שדורשות היגיון רב שלבי.

איפה זה נופל

הבעיה הבולטת ביותר היא הנטייה לחזרות אינסופיות בלולאות פלט, בייחוד אם משתמשים בפענוח חמדני. הדוחות מציינים במפורש שאסור להשתמש ב־greedy decoding במצב חשיבה, וחובה להגדיר פרמטר דגימה כמו presence penalty עד 1.5 כדי לעצור את זה, מה שלעיתים גורם לערבוב שפות ולפגיעה קלה בביצועים. בנוסף, הרחבת ההקשר מעבר לטווח הבסיסי פוגעת בביצועים על טקסטים קצרים, כך שאי אפשר פשוט להשאיר אותה דולקת קבוע.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מבטלים את מצב החשיבה כדי לקבל תשובה מהירה?

אפשר להגדיר enable_thinking כלא פעיל בתבנית ההודעות של הטוקנייזר, או פשוט להוסיף את התגית /no_think ישירות לפרומפט. במצב הזה המודל יענה מיד בלי לייצר בלוק מחשבות מקדים ויחסוך משמעותית בזמן ובמשאבים.

למה המודל נכנס ללולאה וחוזר על אותן מילים?

זה קורה בעיקר כשמגדירים פרמטרי דגימה לא נכונים או מנסים להשתמש בפענוח חמדני. כדי לפתור את זה במצב חשיבה, ודאו שהטמפרטורה מכוונת ל־0.6 עם TopP של 0.95, ובמידת הצורך העלו את ה־presence penalty לכיוון 1.5.

איך מריצים

בזכות כימות FP8, הקבצים שוקלים 4.8 גיגה־בייט בלבד, מה שאומר שאפשר להריץ אותו בקלות על כרטיס מסך ביתי בודד עם 8 עד 12 גיגה זיכרון VRAM, ואפילו על מחשבים ניידים באמצעות Ollama, LMStudio או MLX. לסביבות ייצור, vLLM מגרסה 0.8.5 או SGLang מגרסה 0.4.6 יספקו שרת תואם OpenAI עם תמיכה מלאה במצב החשיבה.

אם אתם עובדים ב־transformers, חובה לשדרג לגרסה 4.51.0 לפחות כדי למנוע קריסה. חשוב לדעת שכימות ה־FP8 כאן עושה בעיות בריצה מבוזרת על פני כמה כרטיסים בספריית transformers, אז אם אתם מתכננים לפצל אותו על כמה מאיצים, תצטרכו להגדיר משתני סביבה מתאימים או פשוט להשתמש בשרת ייעודי כמו vLLM.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-4B-FP8")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו למוצרים מסחריים, לשנות את הקוד והמשקלים, להפיץ אותם מחדש ולשלב בפתרונות סגורים בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים המקורית והצהרת שינויים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗