GPT
Q

Qwen3-0.6B-GGUF

קוד פתוח

Qwenapache-2.02025-05-05

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל שפה קטן של 0.6 מיליארד פרמטרים בפורמט GGUF, שמספק חלון הקשר של 32,768 טוקנים ויכולת חשיבה מובנית בקובץ של 610 מגה בייט בלבד.

  • 610 MBמשקל הקבצים
  • 106,635הורדות בחודש
  • 72לייקים

מה זה

המשקל הכולל של הקבצים מסתכם ב־610 מגה בייט בקוונטיזציית q8_0, שזה גודל זעיר ביחס לעולם מודלי השפה. בתוך הממדים האלה מקבלים 0.6 מיליארד פרמטרים, מתוכם 0.44 מיליארד פרמטרים שאינם שכבות אמבדינג, על גבי 28 שכבות ומנגנון Grouped-Query Attention. החידוש המרכזי פה הוא היכולת לדלג בין מצב חשיבה לוגי ומעמיק לבין מצב שיחה רגיל ומהיר באותו מודל בדיוק, באמצעות פקודות ישירות בטקסט.

לפי הנתונים, המודל עבר אימון מקדים ואימון מתקדם, ותומך ביותר ממאה שפות כולל משימות תרגום וסוכנים אוטונומיים. הוא מחזיק הקשר של 32,768 טוקנים, נתון חריג מאוד לרוחב פס של מודל כל כך קטן. מודלים בנפח הזה בדרך כלל מתקשים בלוגיקה בסיסית, וכאן שילבו מצב ייעודי לפתרון בעיות קוד ומתמטיקה.

מתאים ל

  • עיבוד טקסט במכשירי קצה

    משקל של 610MB מאפשר להריץ אותו ישירות על מעבד מקומי בטלפונים או ברכיבי IoT ללא חיבור רשת.

  • סוכן אוטונומי קל משקל

    המודל אומן להפעלת כלים חיצוניים וכולל מצב חשיבה מהיר לביצוע פקודות וניתוב משימות פשוטות.

  • תרגום וסיווג בשרתים זולים

    תמיכה ביותר ממאה שפות וחלון הקשר גדול מאפשרים מיון וניתוח טקסטים בעלות מחשוב אפסית.

איפה זה נופל

גודל של 0.6B מציב גבולות ברורים, לא משנה כמה אופטימיזציה יש בפנים. המפתחים עצמם מזהירים מפני שימוש ב־greedy decoding, שגורם לנפילה בביצועים ולחזרות אינסופיות על מילים, וממליצים להעלות את קנס הנוכחות ל־1.5. הבעיה היא שהעלאת הקנס הזה עלולה לגרום לערבוב שפות ולפגיעה ברמת הפלט.

בנוסף, יש לנהל ידנית את היסטוריית השיחה כך שלא תכלול את שלבי החשיבה אלא רק את התשובה הסופית, אחרת הדיאלוג משתבש. משימות היגיון סבוכות או פיתוח קוד אמיתי ידרשו בדיקה קפדנית, כי מודלים בגודל כזה נוטים לפספס עובדות ולייצר שגיאות בקלות.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מחליפים בין מצב חשיבה למצב שיחה רגיל?

אתם פשוט מוסיפים את הפקודה think/ או no_think/ לתוך הבקשה של המשתמש או להודעת המערכת. המודל מתאים את אופן המענה לפקודה האחרונה שקיבל בשיחה.

האם המודל דורש כרטיס מסך חזק כדי לתפקד?

לא. משקל הקבצים עומד על 610 מגה בייט בלבד, ולכן אפשר להריץ אותו ישירות על זיכרון RAM רגיל ומעבד פשוט בלי שום כרטיס מסך ייעודי.

למה אסור להשתמש ב־greedy decoding במודל הזה?

המפתחים מזהירים שדגימה כזו מובילה לפגיעה ישירה בביצועים וללולאות טקסט אינסופיות. כדי לקבל פלט תקין, חובה להשתמש בפרמטרים מותאמים וקנס נוכחות של 1.5.

איך מריצים

אתם יכולים להריץ את הקובץ ישירות ב־llama.cpp או דרך פקודה בודדת ב־ollama. בגלל שמדובר ב־610 מגה בייט, אין שום צורך בכרטיס מסך ייעודי. הוא ירוץ במהירות גבוהה כמעט על כל מעבד מודרני במחשב נייד, בשרת ענן זול במיוחד או אפילו במכשירי קצה וטלפונים.

המפתחים מגדירים במפורש את הגדרות הדגימה, כמו טמפרטורה של 0.6 לחשיבה או 0.7 לשיחה רגילה, וממליצים להגדיר קנס נוכחות על 1.5 כדי למנוע חזרות בלולאה. אם אתם צריכים רק מענה פשוט או עיבוד טקסט מקומי, אין טעם לשלם על API חיצוני. קריאה ל־API תהיה עדיפה רק כשצריך הבנה מורכבת שחורגת מהיכולת של מודל תת־מיליארדי.

ollama run hf.co/Qwen/Qwen3-0.6B-GGUF:Q8_0

הקבצים

5 קבצים במאגר, 610 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים מופצים תחת רישיון apache-2.0. מדובר ברישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקבצים והפצה שלהם בתוך מוצרים פרטיים או מסחריים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וצירוף עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗