GPT
Q

unsloth/Qwen3-14B-GGUF

קוד פתוח

unslothapache-2.02025-04-28

  • transformers
  • gguf
  • qwen3
  • text-generation
  • qwen

גרסת קוונטיזציה של מודל 14.8B שמביאה יכולת חשיבה מובנית לצד מצב שיחה רגיל, עם מעבר מהיר ביניהם באותו קובץ.

  • 40,960טוקנים בהקשר
  • 228 GBמשקל הקבצים
  • 42,734הורדות בחודש
  • 140לייקים

מה זה

המודל הזה יושב על ארכיטקטורה של 40 שכבות עם 14.8 מיליארד פרמטרים, כשרק 13.2 מיליארד מתוכם הם לא אמבדינג. החידוש המרכזי כאן הוא השילוב בין מודל חשיבה איטי ומעמיק לבין מודל צ'אט רגיל ומהיר, בלי להחזיק שני משקלים נפרדים בזיכרון. אתם שולטים בזה דרך פרמטר בהגדרות או ישירות מהטקסט עם תגיות ייעודיות.

מבחינת יכולות, הוא מתוכנן לעקוף את ביצועי ההסקה של QwQ ושל Qwen2.5 המקביל, בעיקר בלוגיקה, מתמטיקה והפעלת כלים. ברירת המחדל מפעילה את שרשרת המחשבה ותוחמת אותה בתגיות פנימיות, כך שאפשר לקבל פירוט מלא של תהליך הפתרון לפני התשובה הסופית, או לכבות אותה לחלוטין כשצריך זמני מענה קצרים.

מתאים ל

  • סוכני אוטונומיה והפעלת כלים

    שילוב שרשרת חשיבה עם חיבור לכלים חיצוניים וממשקי MCP, לפתרון משימות מורכבות.

  • פתרון בעיות קוד ומתמטיקה

    מצב החשיבה המובנה מתאים למשימות לוגיות שדורשות פירוק בעיה לשלבים לפני הפלט.

  • בוט שיחה חסכוני במשאבים

    כיבוי מצב החשיבה מאפשר מענה ישיר ומהיר לדיאלוגים שוטפים בלי תקורת זמני הסקה.

איפה זה נופל

חלון ההקשר הטבעי עומד על 32,768 טוקנים, ולמרות שאפשר להרחיב אותו עד 131,072 עם שיטת YaRN, ההטמעה בכלים הפתוחים סטטית ועלולה לפגוע בביצועים בקלטים קצרים. אסור להשתמש בפיענוח מסוג greedy במצב חשיבה כי הוא גורם ללולאות טקסט אינסופיות. בנוסף, העלאת presence penalty כדי לפתור חזרות עלולה לגרום למודל לערבב שפות, ובשיחות מתמשכות חובה לנקות ידנית את בלוק החשיבה מההיסטוריה כדי לא להרוס את הדיוק.

אותה משפחה

Qwen3 יצא ב־10 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מחליפים בין מצב חשיבה למצב רגיל בזמן ריצה?

אפשר להוסיף את המחרוזות think או no_think ישירות לבקשת המשתמש או להודעת המערכת בשיחה מרובת שלבים. לחלופין, מגדירים את הפרמטר enable_thinking בקריאה לתבנית השיחה, אבל במצב כבוי לחלוטין תגיות הטקסט לא ישפיעו.

למה הריפוזיטורי שוקל 228 גיגה בייט?

המשקל הכולל נובע מכך שהדף מרכז 32 קבצים שונים של המודל, הכוללים מגוון גרסאות קוונטיזציה של Unsloth. אתם לא מורידים את הכל, אלא בוחרים קובץ בודד שמתאים לגודל הזיכרון שלכם.

איך מריצים

הדף כולל אוסף קבצים במשקל כולל של 228 גיגה בייט, שמכילים גרסאות שונות של המודל בפורמט GGUF. כדי להריץ קובץ קוונטיזציה בודד של מודל בגודל 14B צריך לרוב כרטיס מסך ביתי חזק או מעבד סביר עם מספיק זיכרון עבודה, תלוי ברמת הדחיסה שתבחרו להוריד. ההרצה עובדת ישירות דרך llama.cpp, Ollama, או שרתים כמו vLLM וסגלנג בגרסאות התומכות.

אם אתם לא רוצים להתעסק עם שרתי הסקה, קביעת תצורת זיכרון והגדרות חלון הקשר, עדיף להשתמש בנקודת קצה מנוהלת בענן שכוללת מראש את ההתאמות לטקסטים ארוכים.

ollama run hf.co/unsloth/Qwen3-14B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, להפיץ אותם מחדש ולשלב אותם במוצרים סגורים, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗