GPT
Q

Qwen3-0.6B-FP8

קוד פתוח

Qwenapache-2.02025-04-28

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת בדיוק FP8 למודל זעיר עם יכולות חשיבה מובנות. הוא שוקל ג'יגה בייט בודד ונכנס בקלות בכל מחשב נייד או שרת קצה.

  • 752Mפרמטרים
  • 40,960טוקנים בהקשר
  • 1.0 GBמשקל הקבצים
  • 341,317הורדות בחודש

מה זה

מדובר במודל שפה קומפקטי שמביא יכולת מעניינת לגודל שלו. יש לו מתג חשיבה פנימי שמאפשר לו להחליט אם לפרק בעיה לחשיבה מעמיקה בתוך תגיות ייעודיות, או לענות מיד בצורה ישירה וחסכונית. השינוי בין המצבים יכול להיעשות ישירות בהגדרות הקריאה או בפרומפט עצמו באמצעות פקודות כמו think ו no_think.

בנוסף לחשיבה, הוא כולל התאמה להפעלת כלים וסוכנים, ותמיכה בלמעלה מ־100 שפות. עם זאת, צריך לזכור שזה עדיין מודל של 752 מיליון פרמטרים. היכולות המורכבות שלו ביחס לגודלו מרשימות, אבל הוא עדיין מוגבל ביכולת העמקה לעומת מודלים גדולים.

מתאים ל

  • סוכן חכם למכשירי קצה

    משקל של ג'יגה בודד ותמיכה מובנית בהפעלת כלים מאפשרים להריץ אותו ישירות במערכות משובצות או מחשבים מקומיים.

  • חילוץ מידע וניתוב טקסט

    כיבוי מצב החשיבה מאפשר עיבוד טקסטים מהיר וזול במיוחד בתשתיות פנימיות.

  • פתרון בעיות לוגיות מקומי

    מצב החשיבה המובנה מספק פירוק שלבים מפורט למשימות קידוד ולוגיקה בסיסית בלי לצאת לענן.

איפה זה נופל

הבעיה הבולטת ביותר כאן היא נטייה לחזרות אינסופיות בלולאות פלט. המפתחים מזהירים מפורשות לא להשתמש ב־greedy decoding אלא לדגום עם טמפרטורה מדויקת, ובמקרה של תקיעות להרים את ה־presence penalty לאזור 1.5, מה שעלול לפגוע בביצועים או לגרום לערבוב שפות. בנוסף, הסקייל של FP8 ב־transformers מציג בעיות בהרצה מבוזרת על כמה כרטיסים ודורש הגדרת משתנה סביבה כדי לא להתרסק.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מכבים את פלט החשיבה כדי לחסוך זמן וטוקנים?

אפשר להעביר enable_thinking=False בתוך התבנית של הצ'אט כדי לחסום את התהליך לחלוטין. אם המצב פועל, אפשר גם לכתוב no_think ישירות בהודעת המשתמש והמודל ידלג על שלב החשיבה באותו תור שיחה.

למה המודל נתקע וחוזר על אותן מילים שוב ושוב?

זה קורה בעיקר כשמריצים דגימה מסוג greedy decoding, שאסורה לפי הוראות היצרן. יש להגדיר טמפרטורה של 0.6 במצב חשיבה או 0.7 במצב רגיל, ובמידת הצורך להעלות את ערך ה־presence penalty לעבר 1.5.

איך מריצים

המשקל הכולל של הקבצים הוא 1.0 ג'יגה בייט בלבד, כך שכל כרטיס מסך בסיסי או מעבד מודרני מריצים אותו בלי להתאמץ. אפשר להעלות אותו עם vLLM, SGLang, או ישירות בספריית transformers, וגם בכלים מקומיים כמו Ollama ו־llama.cpp. שימו לב שחובה לעבוד עם transformers בגרסה 4.51.0 ומעלה כדי לא להיתקל בשגיאות זיהוי של הארכיטקטורה.

אין שום סיבה לשלם על API חיצוני בשביל מודל כזה. הוא קל מספיק כדי לשבת ישירות על השרת שלכם או על מכשיר הקצה, ולחסוך זמני השהיה ועלויות שימוש.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-0.6B-FP8")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים משוחררים תחת רישיון apache-2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על תנאי הרישיון המקוריים ומתן הקרדיט הנדרש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗