GPT
Q

Qwen3-8B-GGUF

קוד פתוח

Qwenapache-2.02025-05-03

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת של מודל עם 8.2 מיליארד פרמטרים, שמסוגל לעבור בין מצב חשיבה עמוקה לשיחה רגילה. מתאים למי שרוצה הרצה מקומית בלי לוותר על יכולות היגיון וקוד.

  • 29.8 GBמשקל הקבצים
  • 376,010הורדות בחודש
  • 273לייקים

מה זה

המודל כולל 8.2 מיליארד פרמטרים, מתוכם 6.95 מיליארד ללא שכבות ההטמעה, ופועל עם 36 שכבות בארכיטקטורת תשומת לב מקובצת. החידוש המרכזי כאן הוא היכולת לדלג בין מצב חשיבה מעמיק למצב שיחה מהיר באותו קובץ בדיוק, באמצעות פקודות פשוטות בפרומפט.

לפי הנתונים, במצב החשיבה הוא עוקף את דגמי QwQ הקודמים, ובמצב הרגיל הוא מציג שיפור לעומת Qwen2.5 במשימות קוד, מתמטיקה והפעלת כלים חיצוניים. ההקשר הטבעי עומד על 32,768 טוקנים, אך בעזרת מנגנון YaRN אפשר למתוח אותו עד 131,072 טוקנים לעיבוד טקסטים ארוכים במיוחד.

מתאים ל

  • פתרון בעיות מתמטיקה וקוד

    מצב החשיבה מאפשר לו להציג שלבי ניתוח מעמיקים ומדויקים בבעיות היגיון מורכבות.

  • סוכנים אוטונומיים

    המבנה שלו מותאם לשילוב כלים חיצוניים וקריאות לפונקציות גם במצב שיחה מהיר וגם בחשיבה.

  • תרגום ושיחה בעשרות שפות

    תמיכה מוצהרת במעל מאה שפות ודיאלקטים, שמתאימה לפרויקטים הדורשים מענה רב לשוני מקומי.

איפה זה נופל

אסור להשתמש בשיטת פענוח חמדנית (greedy), כי המודל נכנס לחזרות אינסופיות ומאבד איכות. כדי למנוע חזרתיות בגרסאות המכווצות, החברה ממליצה לקבוע עונש נוכחות של 1.5, אך מציינת שערך גבוה עלול לפגוע בביצועים ולגרום לערבוב שפות. בנוסף, הרחבת ההקשר מעבר ל־32 אלף טוקנים דורשת הגדרת YaRN סטטית, שפוגעת באיכות המענה בטקסטים קצרים.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך עוברים בין מצב חשיבה למצב רגיל?

אפשר להוסיף את התגיות think/ או no_think/ ישירות להודעת המשתמש או להודעת המערכת. המודל מתאים את צורת הפעולה שלו לפי ההנחיה האחרונה שקיבל בשיחה.

האם צריך לשמור את שלבי החשיבה בהיסטוריית השיחה?

לא, ההנחיה הרשמית היא לנקות את תוכן החשיבה מההיסטוריה ולהשאיר רק את התשובה הסופית. שמירת שלבי החשיבה עלולה לפגוע בדיוק של התשובות הבאות בממשקים שלא משתמשים בתבנית Jinja2 המובנית.

איך מריצים

המודל זמין בקוונטיזציות שונות, מ־q4_K_M החסכונית ועד q8_0 הכבדה, ומיועד להרצה ישירה דרך llama.cpp או פקודה בודדת ב־Ollama. סך כל הקבצים במאגר שוקל 29.8 גיגהבייט, אבל בפועל מורידים רק קובץ אחד שמתאים לכמות הזיכרון שלכם.

גרסאות 4 או 5 ביט ירוצו בנוחות על כרטיס מסך בודד עם 8 עד 12 גיגהבייט זיכרון, בעוד לגרסת 8 ביט תצטרכו כרטיס עם 16 גיגהבייט. אם אתם זקוקים להקשר המלא של 131 אלף טוקנים באופן קבוע, דרישות הזיכרון מזנקות, ושם כבר כדאי לבדוק שימוש בנקודת קצה מנוהלת בענן.

ollama run hf.co/Qwen/Qwen3-8B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

9 קבצים במאגר, 29.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי הקוד והפצה מחדש בתוך מוצרים, ללא תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗