GPT
Q

unsloth/Qwen3-32B-GGUF

קוד פתוח

unslothapache-2.02025-04-28

  • transformers
  • gguf
  • qwen3
  • text-generation
  • qwen

גרסת קוונטיזציה של מודל 32B עם מתג ייחודי למעבר בין מצב חשיבה עמוקה למענה שיחתי רגיל. הוא מתאים למי שצריך יכולות חשיבה מורכבות ומעדיף שליטה מלאה בחומרה מקומית.

  • 40,960טוקנים בהקשר
  • 497 GBמשקל הקבצים
  • 125,270הורדות בחודש
  • 98לייקים

מה זה

מדובר במודל שפה בגודל 32.8 מיליארד פרמטרים שרץ בתצורת GGUF. החידוש המרכזי כאן הוא האפשרות לקבוע אם המודל יפעיל שרשרת חשיבה מעמיקה בסגנון דגמי ריזונינג או יענה מיד כמו מודל שיחה רגיל. המעבר הזה מתבצע באותו קובץ ממש, באמצעות פרמטר ייעודי או אפילו פקודה פשוטה בתוך הטקסט של השיחה.

המודל כולל 64 שכבות ומתאים לעבודה עם כלים חיצוניים וסוכנים אוטונומיים. הוא תומך בהקשר בסיסי של 32,768 טוקנים עם אפשרות מובנית להרחבה עד 131,072 טוקנים באמצעות מנגנון מתיחה, מה שנותן מענה למסמכים ארוכים יחסית בלי להחליף מודל.

מתאים ל

  • פיתוח סוכני קוד מורכבים

    מצב החשיבה מאפשר פתרון בעיות לוגיות וכתיבת סקריפטים עם יכולת קריאה לכלים חיצוניים.

  • בוט שירות מהיר ומדויק

    ביטול מצב החשיבה מחזיר תשובות ישירות בלי לבזבז זמן ומשאבי עיבוד מיותרים.

  • ניתוח מסמכים רחבי היקף

    תמיכה בהקשר של עד 131,072 טוקנים מתאימה לעיבוד קבצי תיעוד וספריות שלמות.

איפה זה נופל

המודל רגיש מאוד להגדרות הדגימה. אסור להשתמש בחיפוש חמדני במצב חשיבה, כי הוא נוטה להיתקע בלולאות אינסופיות של מלל, והעלאת מדד ה־penalty כדי לפתור את זה גורמת לו לערבב שפות. בנוסף, הרחבת ההקשר הארוך מעבר לרגיל פוגעת בביצועים על טקסטים קצרים בגלל מימוש קבוע מראש, כך שלא כדאי להפעיל אותה כשאין צורך ממשי.

אותה משפחה

Qwen3 יצא ב־10 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מכבים את תהליך החשיבה כדי לקבל תשובה מהירה?

אפשר להגדיר את הפרמטר הייעודי ככבוי בהגדרות התבנית, או פשוט להוסיף את התג no_think לגוף ההודעה. המודל יעבור מיידית למענה רגיל וחסכוני.

חייבים להוריד את כל חצי הטרה שמופיע בעמוד?

ממש לא. הקבצים בעמוד מייצגים עשרות גרסאות כיווץ שונות, וצריך להוריד רק קובץ GGUF יחיד ברמת הדיוק שמתאימה לזיכרון כרטיס המסך שלכם.

איך מריצים

בשביל להריץ גרסה מכווצת כזו בקצב עבודה סביר, תצטרכו כרטיס מסך חזק עם לפחות 24GB זיכרון לתצורות הקלות יותר, או שילוב של זיכרון מערכת נדיב בשימוש בתוכנות כמו llama.cpp ו־Ollama. המאגר כולל מגוון רחב של רמות דחיסה מבית Unsloth ששוקלות יחד כמעט 500GB, כך שבוחרים רק קובץ בודד שמתאים למגבלת הזיכרון שלכם.

אם אין לכם חומרה ייעודית עם כרטיסי מסך מקצועיים, הרצה מקומית של מודל בגודל כזה עלולה לזחול. במקרים של עומס נקודתי או שרתים חלשים, זול ומהיר יותר לשלוח קריאות ישירות לשרתי ענן.

ollama run hf.co/unsloth/Qwen3-32B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בחופשיות, כל עוד משאירים את הצהרת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗