GPT
Q

unsloth/Qwen3-8B-GGUF

קוד פתוח

unslothapache-2.02025-04-28

  • transformers
  • gguf
  • qwen3
  • text-generation
  • qwen

גרסת GGUF יעילה למודל 8B שמשלב חשיבה מעמיקה ושיחה רגילה באותו קובץ. הוא נותן פתרון מקומי מדויק למשימות קוד ולוגיקה בלי לשלם על מודלי ענק.

  • 40,960טוקנים בהקשר
  • 124 GBמשקל הקבצים
  • 80,645הורדות בחודש
  • 150לייקים

מה זה

המודל מביא יכולת מעניינת של מעבר גמיש בין מצב חשיבה לבין מצב שיחה רגיל. במקום להחזיק מודל נפרד להסברים מהירים ומודל נפרד להסקה לוגית מורכבת, שולטים בהתנהגות שלו ישירות מהפרומפט בעזרת פקודות כמו think או דרך הגדרות הטמפלייט. במצב חשיבה הוא מייצר בלוק מחשבה ייעודי ומנתח את הבעיה לעומק, ובמצב הרגיל הוא עונה ישר ולעניין כדי לחסוך זמן ומשאבים.

מבחינת מבנה, מדובר על 8.2 מיליארד פרמטרים וחלון הקשר בסיסי של 32,768 טוקנים, שניתן להרחבה עד 131,072 טוקנים באמצעות YaRN. היכולות שלו מכוונות למשימות של כתיבת קוד, מתמטיקה והפעלת כלים חיצוניים דרך סוכנים, עם תמיכה בלמעלה מ־100 שפות.

מתאים ל

  • סוכן אוטונומי להפעלת כלים

    חיבור ישיר לכלי MCP או ל־Qwen-Agent לביצוע משימות מורכבות שמצריכות קריאות API ופירוק שלבים.

  • פתרון בעיות קוד מקומי

    הרצה מקומית במצב חשיבה כדי לאתר באגים ולכתוב אלגוריתמים בלי להוציא קוד פנימי מהרשת.

  • בוט שיחה וסיכום מהיר

    מעבר למצב ללא חשיבה מייצר מענה מיידי וחסכוני במשאבים שמתאים לדיאלוג שוטף מול משתמשים.

איפה זה נופל

אסור להשתמש ב־greedy decoding במצב חשיבה, כי המודל נוטה להיכנס ללופים אינסופיים של מלל ואיכות הפלט נפגעת קשות. כדי להשתלט על חזרתיות תצטרכו להגדיר טמפרטורה מדויקת של 0.6 או 0.7 בהתאם למצב, ולעיתים לשחק עם presence penalty שעלול לפגוע בעקביות השפה.

בנוסף, הרחבת ההקשר מעבר לטווח הטבעי דורשת הגדרת YaRN סטטי ברוב הכלים, מה שעלול לפגוע בדיוק של טקסטים קצרים. שימו לב גם שצריך גרסאות מעודכנות מאוד של transformers וספריות ההרצה, אחרת נתקלים בשגיאות זיהוי של הארכיטקטורה.

אותה משפחה

Qwen3 יצא ב־10 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מכבים את בלוק החשיבה בתשובות?

אפשר להגדיר enable_thinking כ־False בטמפלייט של השיחה, או להוסיף את התגית no_think ישירות לפרומפט. במצב כבוי המודל עונה מיד בלי לייצר תגיות חשיבה כלל.

האם אפשר להשתמש במודל לטקסטים ארוכים במיוחד?

המודל מגיע עם תמיכה מובנית של עד 32,768 טוקנים, ואפשר להרחיב אותו עד 131,072 בעזרת הגדרת YaRN. עם זאת, YaRN סטטי עלול לפגוע בביצועים של טקסטים קצרים ולכן מומלץ להפעיל אותו רק כשיש צורך ממשי.

איך מריצים

המשקל המלא של הקבצים במאגר מגיע ל־124 גיגה בייט כי הוא כולל מגוון רחב של קוונטיזציות, אבל בפועל מורידים רק קובץ GGUF אחד שמתאים לחומרה שלכם. כדי להריץ מודל 8B בקוונטיזציה נפוצה של 4 או 8 ביט, צריך כרטיס מסך עם 8 עד 16 גיגה בייט זיכרון, או מעבד חזק עם מספיק זיכרון מערכת בשימוש עם llama.cpp, Ollama או vLLM.

אם אתם צריכים רק שאילתות בודדות או שאין לכם חומרה ייעודית, קריאה לנקודת קצה מנוהלת תהיה זולה ופשוטה יותר. הרצה מקומית משתלמת כשרוצים שליטה מלאה בפרטיות, עבודה אופליין או חיסכון בעלויות של עיבוד רציף.

ollama run hf.co/unsloth/Qwen3-8B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים והפצה בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗