GPT
Q

Qwen_Qwen3-8B-GGUF

קוד פתוח

bartowskiapache-2.02025-04-28

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסת קוונטיזציה מכווצת למודל של שמונה מיליארד פרמטרים. היא נועדה למי שרוצה להריץ שפה ישירות על חומרה מקומית או שרת קטן בלי להזדקק למערך כרטיסי מסך יקר.

  • 121 GBמשקל הקבצים
  • 32,800הורדות בחודש
  • 38לייקים

מה זה

הריפוזיטורי מכיל המרות GGUF שנוצרו באמצעות llama.cpp עם כיול imatrix על בסיס המודל המקורי של עליבאבא. המטרה היא לקחת מודל טקסט של שמונה מיליארד פרמטרים ולדחוס אותו כך שיתאים למגוון רחב של משאבי זיכרון, החל ממשקלים מלאים בפורמט של 16 ביט ועד כיווצים אגרסיביים של 2 ביט.

המבחר כולל שיטות שונות כמו K quants וגרסאות IQ חדשות יותר, כולל קבצים שבהם שכבות ההטמעה והפלט נשמרו באיכות גבוהה של שמונה ביט. הדחיסה באמצעות imatrix מנסה לשמר את יכולות הניסוח וההבנה של המודל גם כשמורידים את נפח הזיכרון באופן משמעותי.

מתאים ל

  • עוזר מקומי למחשב אישי

    גרסת ברירת המחדל תופסת כחמישה גיגה בייט ויכולה לפעול בצורה חלקה על כרטיס מסך בודד בתוך LM Studio.

  • שרת דל משאבים ומעבדי ARM

    שימוש בגרסאות שתומכות בסידור משקלים בזמן אמת מאפשר חילוץ ביצועים טובים יותר ממכונות מבוססות מעבד.

  • סביבות זיכרון מוגבלות במיוחד

    קבצי ה־IQ הקטנים מציעים תפקוד שמיש בנפחי זיכרון שנעים סביב שלושה עד ארבעה גיגה בייט.

איפה זה נופל

הגרסאות המכווצות מתחת לארבעה ביט סובלות מפגיעה ניכרת באיכות הפלט ומוגדרות מראש כבעלות איכות נמוכה. יתר על כן, הפעלת גרסאות IQ על מעבד רגיל תהיה איטית יותר בהשוואה לחלופות K, מה שדורש בדיקה מדויקת של יחס מהירות מול איכות. כרטיס המודל לא מציג נתוני ביצועים ספציפיים בעברית, ולכן חובה לבדוק תחביר והבנת הקשר מקומי בעצמכם לפני שילוב במערכת פעילה.

אותה משפחה

Qwen-Qwen3 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ ספציפי כדאי להוריד מתוך כל הרשימה?

עבור רוב המשתמשים, גרסת Q4_K_M בגודל 5.03 גיגה בייט היא נקודת ההתחלה הנכונה שמספקת איכות טובה ויציבה. אם יש לכם עודף זיכרון בכרטיס המסך, שווה לעלות לגרסת Q5_K_M או Q6_K לקבלת תוצאות מדויקות יותר. במקרה שהזיכרון מוגבל מאוד, גרסאות ה־IQ באזור השלושה ביט ייתנו פשרה סבירה.

איך צריך לנסח את הפרומפט כדי שהמודל יעבוד נכון?

המודל מצפה למבנה ChatML מוגדר עם תגיות im_start ו־im_end לכל תפקיד בשיחה. המבנה מפריד בין הגדרת המערכת, הודעת המשתמש והמענה של העוזר. שימוש במבנה אחר עלול לפגוע בהבנת ההוראות ובאיכות המענה שתקבלו.

איך מריצים

טוענים קובץ בודד לתוך llama.cpp או LM Studio, בלי להוריד את כל הריפוזיטורי. לביצועים מהירים כדאי לבחור קובץ שקטן בגיגה או שניים מנפח הזיכרון בכרטיס המסך שלכם, כאשר משקל ברירת המחדל המומלץ לרוב השימושים הוא Q4_K_M שתופס 5.03 גיגה בייט.

כרטיס מסך ביתי עם 8 גיגה זיכרון יספיק בקלות לרוב גרסאות הארבעה והחמישה ביט. במעבדי ARM או מעבדים עם AVX אפשר לבחור בגרסאות Q4_0 או IQ4_NL שמנצלות סידור מחדש של המשקלים בזמן אמת לשיפור המהירות. אם אין לכם חומרה ייעודית ואתם צריכים רק מענה מזדמן, פנייה לשרת מרוחק תחסוך את משאבי המחשב.

ollama run hf.co/bartowski/Qwen_Qwen3-8B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי, כולל הפצה ושימוש מסחרי מלא במוצרים סגורים. התנאים דורשים שמירה על הצהרת זכויות היוצרים וצירוף עותק מהרישיון בכל הפצה של הקוד או המשקלים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗