GPT
Q

Qwen_Qwen3-14B-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-04-28

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסת GGUF מכווצת של מודל 14B מבית Qwen, שמתאימה להרצה מקומית דרך llama.cpp. היא נותנת פשרה מעולה בין יכולות חזקות לבין צריכת זיכרון שמתאימה לחומרה ביתית סבירה.

  • 224 GBמשקל הקבצים
  • 98,427הורדות בחודש
  • 40לייקים

מה זה

מדובר בהמרה לקובצי GGUF של Qwen3-14B, שנעשתה באמצעות llama.cpp גרסה b5200 וכיול imatrix כדי לצמצם פגיעה באיכות. גודל של 14 מיליארד פרמטרים תופס נקודת אמצע נוחה מאוד, הוא חכם בהרבה ממודלים זעירים של 3B או 7B, אבל לא דורש שרת עם כרטיסי מסך מרובים כמו מודלי 70B.

הקובץ המקורי של BF16 שוקל 29.54GB, אך bartowski ייצר כאן מגוון רחב של כימותים שיורדים עד ל־4.69GB בגרסת IQ2_XS. חלק מהגרסאות, כמו Q4_K_L או Q6_K_L, משאירות את שכבות ה־embed והפלט בדיוק של Q8_0 כדי לשמור על יציבות הטקסט בלי לנפח את שאר המשקולות.

מתאים ל

  • עוזר פיתוח מקומי

    גרסת Q4_K_M יושבת בנוחות על כרטיס מסך בודד של 12GB ומספקת מענה מקומי בלי לשלוח קוד החוצה.

  • עיבוד מידע רגיש בארגון

    הרצה מקומית מלאה בתוך הרשת הפנימית דרך llama.cpp, מה שמונע דליפת מידע פרטי לספקים חיצוניים.

  • הרצה על שרתי מעבד ו־ARM

    שימוש בגרסאות Q4_0 או IQ4_NL מאפשר ניצול יעיל של חומרת מעבד בזכות סידור משקולות בזמן ריצה.

איפה זה נופל

הגרסאות המכווצות ביותר, במיוחד אלה שמתחת ל־Q3 כמו IQ2 או Q2_K, מוגדרות במפורש כבעלות איכות נמוכה. שימוש ברמות כימות אגרסיביות כאלה עלול לפגוע בהיגיון הפנימי של המודל ולהגביר הזיות. בנוסף, מי שבוחר בגרסאות IQ ומריץ על מעבד יסבול מירידה מורגשת בקצב יצירת הטוקנים לעומת גרסאות K מקבילות.

אותה משפחה

Qwen-Qwen3 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כדאי לי להוריד אם יש לי כרטיס מסך של 16GB?

לכו ישר על Q5_K_M ששוקל 10.51GB או אפילו Q6_K ששוקל 12.12GB. הם ישבו כולם בתוך הזיכרון של הכרטיס, ירוצו במהירות מקסימלית וייתנו איכות פלט קרובה מאוד למודל המקורי.

מה עדיף לי לבחור, פורמט K או פורמט IQ?

אם אתם הולכים על רמות כימות של Q4 ומעלה, גרסאות K כמו Q4_K_M הן הבחירה הפשוטה והבטוחה. אם אתם ממש קצרים בזיכרון וחייבים לרדת מתחת ל־Q4, גרסאות ה־IQ ייתנו לכם פלט איכותי יותר ביחס לגודל הקובץ, במיוחד על כרטיסי מסך.

איך מריצים

אתם מורידים קובץ בודד מתוך הרשימה ומריצים אותו ישירות ב־llama.cpp או דרך ממשק כמו LM Studio. כדי לקבל מהירות טובה כדאי לבחור גרסה שקטנה ב־1 עד 2 ג'יגה־בייט מנפח ה־VRAM של כרטיס המסך שלכם, למשל Q4_K_M ששוקל 9GB ומתאים בול לכרטיסי 12GB או 16GB. אם אתם מכוונים לדיוקים נמוכים יותר מ־Q4, עדיף לבחור בגרסאות ה־IQ אם אתם על כרטיסי Nvidia או AMD.

אם אין לכם כרטיס מסך מתאים והכול רץ על המעבד, אפשר להשתמש ב־Q4_0 או IQ4_NL שמנצלים אופטימיזציות מובנות למעבדי ARM ו־AVX. עם זאת, אם אתם צריכים לשרת מאות משתמשים במקביל או שאין לכם חומרה ייעודית, עדיף לפנות ל־API חיצוני ולחסוך את כאב הראש התפעולי.

ollama run hf.co/bartowski/Qwen_Qwen3-14B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון לא דווח בעמוד של bartowski. המודל המקורי שייך לצוות Qwen, ולכן לפני שילוב שלו במוצר מסחרי חובה לבדוק את תנאי הרישיון המדויקים במאגר המקורי כדי לוודא שאין עליכם מגבלות הפצה או שימוש מסחרי.

הרישיון המלא בעמוד המודל ↗