GPT
Q

Qwen3-14B-GGUF

קוד פתוח

Qwenapache-2.02025-05-01

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת קבצים מכווצים למודל עם 14.8 מיליארד פרמטרים. הוא מאפשר מעבר יזום בין חשיבה מעמיקה ופתרון בעיות לבין שיחה רגילה ומהירה באותו קובץ.

  • 53.6 GBמשקל הקבצים
  • 177,210הורדות בחודש
  • 127לייקים

מה זה

מדובר במודל שכולל 14.8 מיליארד פרמטרים, עם 40 שכבות וארכיטקטורת תשומת לב מסוג GQA. החידוש המרכזי כאן הוא היכולת לדלג בין שני מצבי עבודה באמצעות פקודות פשוטות בטקסט. במצב חשיבה הוא מפרק בעיות מתמטיקה, לוגיקה ותכנות לשלבים ארוכים, ובמצב רגיל הוא עונה מיד ומתאים לשיחה שוטפת או לשימוש בסוכנים עצמאיים.

המודל מגיע עם חלון הקשר טבעי של 32,768 טוקנים, ותומך ביותר ממאה שפות לפי הצהרת היוצרים. המדידות בכרטיס לא כוללות ציונים מספריים מדויקים, אבל מצהירות על עקיפה של דגמי QwQ וגרסאות קודמות של Qwen2.5 במשימות קוד, חשיבה מורכבת ומעקב אחרי הוראות אנושיות.

מתאים ל

  • פתרון בעיות קוד ומתמטיקה

    מצב החשיבה מפרט את שלבי הלוגיקה לעומק ומייצר פתרונות מנומקים עד 38,912 טוקנים.

  • סוכנים מרובי כלים

    הוא יודע להפעיל כלים חיצוניים במענה ישיר או אחרי ניתוח מעמיק לפי צורך.

  • עיבוד מסמכים ארוכים

    בעזרת הגדרות YaRN אפשר להרחיב את חלון ההקשר עד 131,072 טוקנים לקריאת טקסט רחב.

איפה זה נופל

המודל רגיש מאוד להגדרות הדגימה שלו. אסור להשתמש בחיפוש חמדן, שמביא לחזרות אינסופיות ולשבירת התשובות, והיוצרים ממליצים להגדיר קנס נוכחות של 1.5 בגרסאות המכווצות כדי לעצור פלט חוזר. קנס כזה עלול לגרום לערבוב שפות ולפגיעה קלה באיכות הטקסט.

מעבר לכך, שימוש בהרחבת הקשר בשיטת YaRN סטטית במסגרות פתוחות משפיע לרעה על איכות התשובות בטקסטים קצרים. אם לא תדאגו לנקות את בלוקי החשיבה מההיסטוריה בשיחות מרובות שלבים, הביצועים שלו יתדרדרו במהירות.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך שולטים במצב החשיבה של המודל בזמן הרצה?

מוסיפים את המחרוזת think או no_think לפרומפט של המשתמש או להודעת המערכת. המודל מתאים את עצמו לפי ההוראה האחרונה שקיבל ברצף השיחה.

למה התשובות חוזרות על עצמן בלולאה?

הגרסאות המכווצות דורשות הגדרת קנס נוכחות של 1.5 וטמפרטורה שבין 0.6 ל־0.7. שימוש בחיפוש חמדן ללא קנס גורם למודל להיתקע בחזרות.

איך מריצים

המשקל הכולל של הקבצים במאגר הוא 53.6 גיגה בייט ומחולק לחמש רמות כיבוץ שונות, החל מכיבוץ קל כמו q8_0 ועד לרמות דחוסות יותר כמו q4_K_M. אפשר להריץ אותו מקומית בפקודה אחת דרך ollama או באמצעות llama.cpp, כשהוא דורש מעבד גרפי שמסוגל להחזיק משקל של לפחות עשרה עד עשרים גיגה בייט בזיכרון, תלוי בגרסה שבחרתם.

אם אין לכם כרטיס מסך מתאים ואתם צריכים לפתוח הקשרים ארוכים שמגיעים עד 131,072 טוקנים באמצעות YaRN, עדיף לפנות לנקודת קצה מנוהלת בענן. הרחבת ההקשר הזו תופסת כמות זיכרון גדולה מאוד ומאיטה את קצב הייצור במחשב אישי.

ollama run hf.co/Qwen/Qwen3-14B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗