GPT
Q

Qwen3-32B-GGUF

קוד פתוח

Qwenapache-2.02025-05-01

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת GGUF למודל של 32.8 מיליארד פרמטרים, שמאפשרת מעבר ישיר בין מצב חשיבה עמוקה לשיחה רגילה. מתאים למי שרוצה ביצועי קוד ומתמטיקה חזקים בריצה מקומית.

  • 119 GBמשקל הקבצים
  • 183,858הורדות בחודש
  • 69לייקים

מה זה

המודל מציע שילוב נדיר למדי, מנגנון פנימי שמאפשר לעבור בין מצב חשיבה עם שרשרת היגיון מלאה לבין מצב שיחה מהיר באמצעות פקודות פשוטות בפרומפט. זה חוסך תחזוקה של שני מודלים נפרדים למשימות שונות באותה מערכת. לפי היצרן, במצב חשיבה הוא עוקף את דגמי QwQ הקודמים, ובמצב רגיל הוא עולה על סדרת Qwen2.5 בפתרון בעיות היגיון, מתמטיקה ותכנות.

הוא כולל תמיכה מובנית בלמעלה ממאה שפות, יכולות שימוש בכלים חיצוניים בשני המצבים, וחלון הקשר בסיסי של 32,768 טוקנים שאפשר להרחיב עד 131,072 בעזרת מנגנון YaRN. זה מודל צפוף עם 64 שכבות, שנותן מענה רחב למפתחי סוכנים שרוצים לבצע לוגיקה מורכבת בלי לפנות לשרתים חיצוניים.

מתאים ל

  • סוכנים מבוססי כלים

    יודע לקרוא לפונקציות ולשלב כלים חיצוניים תוך כדי הפעלת שיקול דעת לוגי או במענה מהיר.

  • פתרון בעיות קוד ומתמטיקה

    מצב החשיבה מפיק פתרונות מפורטים ומדויקים יותר מהדורות הקודמים של הסדרה.

  • עבודה מקומית רב-לשונית

    מאפשר תרגום ועיבוד ביותר ממאה שפות ישירות על שרת עצמאי ללא תלות ברשת.

איפה זה נופל

המודל סובל מבעיית חזרתיות בגרסאות המכומתות, ולכן היצרן מחייב שימוש בערך presence penalty של 1.5. אסור להשתמש בחיפוש חמדני, greedy decoding, שמוביל ללולאות טקסט אינסופיות וירידה בביצועים. בנוסף, העלאת העונש על חזרתיות עלולה לגרום לערבוב שפות ולפגיעה קלה באיכות. הרחבת ההקשר ל־131 אלף טוקנים בשיטת YaRN סטטית עלולה לפגוע באיכות הדיוק בטקסטים קצרים, ובהיסטוריית שיחה מרובת שלבים חובה לחתוך ידנית את תגי החשיבה הקודמים כדי לא לשבור את ההקשר.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך שולטים במעבר בין מצב חשיבה למצב רגיל?

מוסיפים לפרומפט או להודעת המערכת את התג no_think למענה מהיר וחסכוני, או think למענה שכולל ניתוח מעמיק. המודל מתאים את עצמו להוראה האחרונה שנמסרה בשיחה.

למה התשובות חוזרות על עצמן בריצה מקומית?

בגרסאות מכומתות יש נטייה לחזרתיות. חובה להגדיר presence penalty ברמה של 1.5 ולהימנע לחלוטין משימוש ב־greedy decoding בהגדרות הדגימה של המנוע.

האם כדאי להפעיל תמיד את הרחבת ההקשר המקסימלית?

לא. שימוש ב־YaRN סטטי ב־llama.cpp פוגע בביצועים על טקסטים קצרים. מומלץ להפעיל את ההרחבה רק כשיש מסמכים שעוברים את רף 32,768 הטוקנים הבסיסי.

איך מריצים

ההורדה המלאה של כל קובצי ה־GGUF שוקלת 119 ג'יגה בייט ומכילה מספר רמות כימות, החל מ־q4_K_M ועד Q8_0. אפשר להריץ אותו ישירות דרך llama.cpp או בפקודה אחת ב־ollama. כדי להריץ כימות כמו Q8_0 במלואו על המעבד הגרפי צריך כרטיס עם זיכרון משמעותי, או שתידרש פשרה על כימות של 4 ביט כדי לחלק את העומס על חומרה ביתית.

אם אתם צריכים רק שאילתות קצרות מדי פעם, כנראה שעדיף לשלם על קריאות שרת. המודל דורש משאבים כבדים כדי לספק מהירות תגובה סבירה, במיוחד במצב חשיבה שבו הוא מייצר טקסט ארוך לפני התשובה הסופית.

ollama run hf.co/Qwen/Qwen3-32B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים, הפצה פנימית או שילוב במוצרים מסחריים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים ונוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗