GPT
Q

Qwen/Qwen3-4B-GGUF

קוד פתוח

Qwenapache-2.02025-05-05

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל שפה קטן של 4 מיליארד פרמטרים שמשלב מצב חשיבה עמוקה ומצב שיחה מהיר באותו קובץ. הוא מתאים למי שרוצה יכולות היגיון וקוד מקומיות בלי לתפוס נפח זיכרון עצום.

  • 14.7 GBמשקל הקבצים
  • 354,753הורדות בחודש
  • 156לייקים

מה זה

המודל מגיע בארכיטקטורה צפופה של 4 מיליארד פרמטרים, שמתוכם 3.6 מיליארד אינם שכבות שיכון, עם 36 שכבות בסך הכול. החידוש המרכזי כאן הוא היכולת לעבור בין מצב חשיבה למצב רגיל באמצעות פקודות ישירות כמו think ו־no_think בתוך השיחה, כך שלא צריך להחזיק שני מודלים נפרדים למשימות שונות.

הוא מיועד להסקה לוגית, פתרון בעיות מתמטיות וכתיבת קוד במצב החשיבה, לצד מענה מהיר בשיחות מרובות תורות ושימוש בכלים וסוכנים. המודל תומך ביותר מ־100 שפות וניבים, ומספק חלון הקשר טבעי של 32,768 טוקנים שניתן להרחבה עד 131,072 טוקנים בעזרת שיטת YaRN.

מתאים ל

  • סוכני קוד ומשימות לוגיות

    מצב החשיבה מספק פתרון מפורט צעד אחר צעד לבעיות מתמטיקה ותכנות בחומרה מקומית.

  • עבודה עם טקסטים ארוכים

    תמיכה בהקשר של עד 131,072 טוקנים מאפשרת ניתוח מסמכים כבדים ישירות ב־llama.cpp.

  • עוזרי שיחה רב-לשוניים

    המודל תומך ביותר ממאה שפות ומאפשר מעבר מהיר למצב שיחה קליל ללא שלבי חשיבה.

איפה זה נופל

הכרטיס מזהיר שחלונות הקשר ארוכים מבוססי YaRN סטטי עלולים לפגוע בביצועים של טקסטים קצרים, ולכן לא מומלץ להפעיל את ההרחבה כברירת מחדל. בנוסף, חל איסור להשתמש ב־greedy decoding כי הוא מוביל להידרדרות ביצועים ולחזרות אינסופיות. הגדלת ה־presence penalty אמנם מרסנת חזרתיות במודל מכומת, אך היא עלולה לגרום לערבוב שפות ולפגיעה מסוימת באיכות. בשיחות מרובות תורות חייבים לוודא שקטעי החשיבה מנוקים מההיסטוריה כדי לא להעמיס על המודל.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מונעים מהמודל להיתקע בלולאות של טקסט חוזר?

היוצרים ממליצים להגדיר presence penalty ברמה של 1.5 עבור הגרסאות המכומתות, ולא להשתמש בשום אופן ב־greedy decoding. כדאי להישאר עם טמפרטורה של 0.6 במצב חשיבה או 0.7 במצב שיחה רגיל.

מה צריך לזכור כשמנהלים שיחה מרובת שלבים?

חובה לוודא שתוכן תגיות החשיבה לא נשמר בהיסטוריית השיחה שנשלחת חזרה למודל, אלא רק התשובה הסופית. התבנית המובנית בפורמט Jinja2 מטפלת בזה, אך בכל מימוש אחר צריך לנקות את הטקסט ידנית.

האם כדאי להפעיל תמיד את הרחבת ההקשר ל־131 אלף טוקנים?

לא. מימוש YaRN ברוב הכלים הוא סטטי, והוא עלול לפגוע באיכות התשובות על טקסטים קצרים. מומלץ להפעיל את ההרחבה רק כשבאמת מזינים מסמכים שעוברים את מגבלת 32,768 הטוקנים הטבעית.

איך מריצים

בפועל אפשר להריץ אותו מיד דרך llama.cpp או באמצעות פקודה בודדת ב־ollama. המאגר כולל מגוון גרסאות מכומתות כמו q4_K_M, q5_0, q5_K_M, q6_K ו־q8_0, שמאפשרות להריץ אותו בקלות גם על מעבד גרפי ביתי צנוע או ישירות על גבי זיכרון המחשב.

היוצרים ממליצים במפורש לעבוד עם presence penalty ברמה של 1.5 כדי למנוע לולאות חזרתיות בגרסאות המכומתות. אם אתם צריכים רק תגובות ארוכות מאוד עם הקשר של 131 אלף טוקנים באופן קבוע בלי להגדיר YaRN סטטי שפוגע בטקסטים קצרים, שווה לשקול פנייה לנקודת קצה מנוהלת בענן שתומכת בזה באופן דינמי.

ollama run hf.co/Qwen/Qwen3-4B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

9 קבצים במאגר, 14.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה חופשית, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. אפשר לשלב אותו במוצרים פנימיים או מסחריים בלי לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗