GPT
Q

unsloth/Qwen3-0.6B-GGUF

קוד פתוח

unslothapache-2.02025-04-28

  • transformers
  • gguf
  • qwen3
  • text-generation
  • qwen

גרסת GGUF מכווצת של מודל שפה זעיר עם 0.6 מיליארד פרמטרים. מתאים למי שחייב להריץ מודל חושב מקומית על מחשב פשוט או טלפון בלי לשלם על שרתי ענן.

  • 40,960טוקנים בהקשר
  • 10.2 GBמשקל הקבצים
  • 94,367הורדות בחודש
  • 140לייקים

מה זה

מדובר במודל שפה קומפקטי במיוחד שמגיע מבית עליבאבא ועבר המרה לפורמט GGUF על ידי צוות Unsloth. למרות גודלו המזערי, הוא כולל מנגנון שמאפשר לעבור בין מצב חשיבה מעמיק עם תגיות ייעודיות לבין מצב שיחה רגיל ומהיר. הדבר מאפשר לו לנסות להתמודד עם שאלות לוגיקה, קוד ומתמטיקה מעבר למה שמצפים ממודל של פחות ממיליארד פרמטרים.

בנוסף ליכולות החשיבה, הוא תומך בהפעלת כלים חיצוניים ומערכות סוכנים, וכולל תמיכה מוצהרת במעל למאה שפות שונות. המפרט הטכני מציין חלון הקשר של עשרות אלפי טוקנים, מה שמאפשר לו לקלוט טקסטים ארוכים יחסית, אם כי הכרטיס מציג סתירה קלה בין נתון של 32,768 טוקנים בעמוד לבין 40,960 טוקנים בהגדרות הטכניות.

מתאים ל

  • הפעלה מקומית על מכשירי קצה

    צריכת הזיכרון הנמוכה מתאימה למחשבים ישנים, מחשבי לוח או טלפונים שאין להם גישה לרשת.

  • סוכן פשוט להפעלת כלים

    המודל כולל אימון לקריאה לכלים חיצוניים ויכול לשמש רכיב החלטה מהיר במערכות אוטומציה.

  • משימות סיווג וסיכום באנגלית

    ללא מצב חשיבה הוא מייצר תגובות במהירות גבוהה ומתאים לתיוג טקסטים או חילוץ נתונים.

איפה זה נופל

זה עדיין מודל של 0.6 מיליארד פרמטרים, ולא מנוע ענק. הוא נוטה לחזרות אינסופיות בלולאות פלט אם משתמשים בדגימה חמדנית, ולכן היצרן אוסר עליה במפורש ומחייב הגדרת טמפרטורה מדויקת. בנוסף, חלון ההקשר המדווח לא לגמרי עקבי בין חלקי התיעוד. למרות הצהרה על תמיכה בהמון שפות, מטא הדאטה מסמן אנגלית בלבד, כך שאיכות העברית דורשת בדיקה קפדנית לפני שמסתמכים עליה.

אותה משפחה

Qwen3 יצא ב־10 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל יודע לעבוד בעברית?

התיעוד טוען לתמיכה במעל למאה שפות, אבל הגדרות המודל מסמנות אנגלית בלבד. במודלים קטנים כאלה העברית בדרך כלל בסיסית מאוד. מומלץ לבדוק את הביצועים עם הפרומפטים שלכם לפני שמתחייבים עליו.

למה התשובות נתקעות בלולאות חוזרות?

היצרן מדגיש שאסור להשתמש בחיפוש חמדני במצב חשיבה. חובה להגדיר טמפרטורה סביב 0.6, להשתמש במדדי דגימה כמו TopP ו־TopK, ואפשר להעלות את קנס הנוכחות presence penalty כדי לשבור חזרות.

איך מריצים

כדי להריץ אותו לא צריך כרטיס מסך ייעודי של שרתים. פורמט GGUF נבנה עבור llama.cpp, Ollama וממשקים דומים, כך שזיכרון עבודה פשוט של כמה גיגה בייט במחשב אישי מספיק בהחלט. כל המשקל של הקבצים יחד הוא 10.2 גיגה בייט ומחולק לעשרות קבצים שמכילים רמות כיול שונות, כך שאפשר לבחור קובץ יחיד שמתאים למגבלות הזיכרון שלכם.

ההרצה מתבצעת ישירות מול המעבד או על כרטיס גרפי ביתי, תוך שימוש בפקודות כמו think או no_think כדי לשלוט במצב העבודה. אם אתם זקוקים לתשובות מהירות בלי להעמיס על המעבד המקומי, שווה לשקול פנייה לשרת מרוחק דרך vLLM או SGLang, שניהם נתמכים ישירות בהנחיות המקוריות.

ollama run hf.co/unsloth/Qwen3-0.6B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. הרישיון מאפשר שימוש חופשי לגמרי, כולל שינוי של הקוד והמשקולות, שילוב במוצרים מסחריים והפצה ללקוחות. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים ועותק הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗