GPT
Q

Qwen3-4B-Thinking-2507-GGUF

קוד פתוח

unslothapache-2.02025-08-06

  • transformers
  • gguf
  • qwen
  • qwen3
  • unsloth

גרסה מכווצת של מודל חשיבה עם ארבעה מיליארד פרמטרים וחלון הקשר עצום. היא פונה למי שמחפש יכולות פתרון בעיות וקוד בלי להחזיק שרת יקר.

  • 63.2 GBמשקל הקבצים
  • 6,243הורדות בחודש
  • 106לייקים

מה זה

המודל מגיע עם 4.0 מיליארד פרמטרים, מתוכם 3.6 מיליארד ללא שכבות ההטמעה, ותומך באופן טבעי בחלון הקשר של 262,144 תווים. המאפיין המרכזי שלו הוא מצב חשיבה בלעדי שפועל תמיד, ללא צורך בהגדרה ידנית, ומייצר תהליך מחשבה לפני התשובה הסופית דרך תבנית שיחה ייעודית.

במדדי ביצועים המודל מציג זינוק ניכר מול הגרסה הקודמת בגודל הזה. במבחן AIME25 למתמטיקה הוא עולה מציון של 65.6 לציון 81.3, ובמדד הקוד LiveCodeBench הוא מטפס מ־48.4 ל־55.2. הוא מתמודד בהצלחה גם במשימות הפעלת כלים וסוכנים, שם קיבל 71.2 במדד BFCL-v3 לעומת 65.9 בעבר.

מתאים ל

  • פתרון בעיות מתמטיקה

    התוצאה של 81.3 במדד AIME25 מראה יכולת ניתוח מורכבת שמתאימה למשימות חישוב הדורשות שלבי הנמקה רבים.

  • הפעלת סוכנים וכלים

    ציון של 71.2 ב־BFCL-v3 מאפשר שילוב ישיר עם Qwen-Agent וקריאה לפונקציות חיצוניות דרך הגדרות MCP.

  • כתיבת קוד ובדיקות

    הוא מגיע לציון 55.2 ב־LiveCodeBench, שיפור ניכר שמאפשר לייצר לוגיקה תכנותית מדויקת בתוך מסגרת של 4B.

איפה זה נופל

החיסרון הראשי נובע מאופי העבודה של המודל. הוא מחייב חשיבה ארוכה בכל פנייה, מה שמייצר זמני תגובה איטיים שלא יתאימו לממשקי צ'אט מהירים. כדי לקבל תוצאות טובות באמת במשימות חישוב ותכנות, התיעוד דורש להקצות פלט של עד 81,920 טוקנים, דרישה שזוללת משאבי זיכרון ויכולה לגרום לשגיאות חוסר זיכרון אם המערכת אינה מותאמת. בנוסף, העלאת פרמטר presence_penalty כדי למנוע חזרות מביאה לעיתים לערבוב שפות ולירידה בביצועים.

שאלות
נפוצות

האם אפשר לכבות את מנגנון החשיבה כדי לקבל תשובות מיידיות?

לא, המודל הזה תומך רק במצב חשיבה והפרמטר להפעלתו כבר אינו נדרש. תבנית השיחה מוסיפה תגית חשיבה כברירת מחדל, כך שהוא תמיד מייצר שרשרת מחשבה לפני התוצאה הסופית.

איך צריך לנהל את היסטוריית השיחה בפניות מרובות?

התיעוד מנחה להסיר את תוכן החשיבה מהיסטוריית השיחה ולהשאיר בה רק את התשובות הסופיות. אם תבנית ה־Jinja2 אינה מיושמת אצלכם אוטומטית, עליכם לנקות את תגיות החשיבה ידנית לפני שליחת השיחה החוזרת.

איך מריצים

הקובץ מגיע בפורמט GGUF מחולק ל־31 חלקים במשקל כולל של 63.2 גיגה בייט עבור כלל הגרסאות, ונטען ישירות בכלים כמו Ollama או llama.cpp. לשרת ייעודי אפשר להרים אותו עם vLLM מגרסה 0.8.5 ומעלה או SGLang מגרסה 0.4.6.post1 ומעלה, תוך הגדרת מפענח חשיבה של deepseek-r1.

מי שרוצה לנצל את מלוא ההקשר של 256 אלף טוקנים ייתקל בבעיות זיכרון קשות ויצטרך להגביל את ההקשר, רצוי לא מתחת ל־131,072 טוקנים. אם אין לכם כרטיס עם מספיק זיכרון להקשר ארוך ופלט של עד 32,768 טוקנים, תשלום על קריאות בודדות יחסוך את הכאב ראש הזה.

ollama run hf.co/unsloth/Qwen3-4B-Thinking-2507-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצר, ללא תשלום תמלוגים. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗