GPT
Q

Qwen3-0.6B

קוד פתוח

Qwenapache-2.02025-04-27

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

זה מודל קל משקל של 752 מיליון פרמטרים שמשלב חשיבה מעמיקה ודיאלוג מהיר. הוא מתאים למי שרוצה להריץ שרת מקומי זעיר בלי לשלם על משאבי חישוב כבדים.

  • 752Mפרמטרים
  • 40,960טוקנים בהקשר
  • 1.4 GBמשקל הקבצים
  • 21,493,027הורדות בחודש

מה זה

המודל מגיע עם 751,632,384 פרמטרים ברוטו, כאשר 0.44 מיליארד מתוכם הם שכבות החישוב עצמן ללא שכבת הוטמעות. המאפיין הבולט כאן הוא היכולת לדלג בין מצב חשיבה שיוצר תגיות ייעודיות לבין מצב רגיל ומהיר, הכל בתוך אותו קובץ משקלים. המפתחים אימנו אותו להתמודד עם מעל מאה שפות ודיאלקטים, לצד קריאה לכלים חיצוניים בתצורת סוכן.

בגודל הזה, חלון הקשר של 32,768 טוקנים לפי דף הדגם הוא נתון חריג לטובה. הוא מאפשר לעבד טקסטים ארוכים יחסית ישר על המכשיר. במקום להחזיק מודל נפרד להסברים ומודל נפרד לקוד, מקבלים יחידה אחת שיודעת לנתח לוגיקה במגבלות הנפח שלה.

מתאים ל

  • סוכנים אוטונומיים זעירים

    הוא יודע להפעיל כלים ולקרוא לפונקציות חיצוניות דרך מודל קל שלא מעמיס על שרת ההרצה.

  • פתרון בעיות היגיון וקוד

    מצב החשיבה המובנה מייצר שלבי פתרון מפורטים לפני שליפת התשובה הסופית במשימות מתמטיקה.

  • עיבוד מקומי במכשיר קצה

    המשקל הנמוך, 1.4 גיגה בייט, מאפשר לו לרוץ בזיכרון של מחשבים ניידים ללא צורך בענן.

איפה זה נופל

היוצרים מזהירים מפני חזרתיות אינסופית בטקסט, וממליצים להגדיר קנס נוכחות של עד 1.5 כדי לעצור את זה. אסור להשתמש בפענוח חמדן כי הוא פוגע בביצועים ומחמיר את הלולאות. העלאת קנס הנוכחות פותרת חזרות, אבל עלולה לערבב שפות בטעות ולהוריד את הדיוק הכללי.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מבטלים את פלט החשיבה הארוך כדי לקבל תשובות מהירות?

מגדירים את הפרמטר enable_thinking לערך False בטמפלייט של הצ'אט, או שולחים את הפקודה no_think בהודעת המשתמש. במצב הזה הוא מדלג על תגיות החשיבה ופולט טקסט רגיל בקצב גבוה.

למה מופיעה שגיאת מפתח בריצת הקוד בספריית transformers?

הארכיטקטורה של Qwen3 נתמכת רק מגרסה 4.51.0 ומעלה של הספרייה. גרסאות ישנות יותר לא מכירות את סוג המודל וזורקות שגיאת KeyError בעלייה.

איך מונעים מהמודל להיתקע בלולאות של טקסט חוזר?

משתמשים בהגדרות הדגימה המומלצות, שכוללות טמפרטורה של 0.6 במצב חשיבה, ומעלים את פרמטר presence_penalty עד לערך של 1.5. בנוסף, חובה להימנע מפענוח חמדן.

איך מריצים

המשקלים שוקלים 1.4 גיגה בייט בלבד בדיוק bfloat16, כך שכל כרטיס גרפי בסיסי או מעבד מודרני מריץ אותו בקלות. אפשר להעלות אותו במערכות כמו vLLM מגרסה 0.8.5, SGLang, Ollama או ישירות דרך ספריית transformers העדכנית, שחייבת להיות לפחות בגרסה 4.51.0 כדי לזהות את הארכיטקטורה.

אין סיבה לשלם על API חיצוני בשביל גודל כזה. שרת זול או מחשב פיתוח פשוט סוגרים את הפינה, אלא אם התשתית שלכם מבוזרת לחלוטין ואתם מעדיפים לא לתחזק שרתים עצמאיים כלל.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-0.6B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, להפיץ אותם מחדש ולשלב במוצרים סגורים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗