GPT
Q

Qwen3-4B-Instruct-2507-GGUF

קוד פתוח

unslothapache-2.02025-08-06

  • transformers
  • gguf
  • qwen
  • qwen3
  • unsloth

גרסת הוראות מכווצת של מודל 4B עם חלון של 256K שמגיעה בלי בלוקי חשיבה מובנים. הוא מתאים למי שחייב ביצועים גבוהים בקוד והיגיון על חומרה מקומית צנועה.

  • 63.2 GBמשקל הקבצים
  • 113,009הורדות בחודש
  • 201לייקים

מה זה

מדובר במודל שפה עם 4 מיליארד פרמטרים בפורמט GGUF, שמבוסס על עדכון 2507 של סדרת Qwen3. המאפיין הבולט כאן הוא הסרת מצב החשיבה הפנימי, כך שהוא מחזיר תשובות ישירות בלי לייצר תגיות חשיבה ובלי לדרוש הגדרות מיוחדות לכיבוי המנגנון. הוא מחזיק חלון הקשר טבעי של 262,144 טוקנים, נתון חריג למודלים בגודל כזה שמאפשר לטעון תיעוד שלם לזיכרון.

במבחני הביצועים הוא עוקף לא מעט מודלים גדולים ממנו במשימות מוגדרות. הוא מקבל 80.2 ב־ZebraLogic לעומת 35.2 בגרסה הקודמת, ומגיע ל־47.4 במבחן המתמטי AIME25. במשימות תכנות כמו LiveCodeBench הוא עומד על 35.1, ובמדדי כתיבה והעדפת משתמש הוא רושם קפיצה משמעותית שמציבה אותו קרוב מאוד למודלים של 30B.

מתאים ל

  • סוכן כלים מקומי

    המודל קיבל 61.9 ב־BFCL ומותאם מראש לעבודה ישירה מול קריאות לפונקציות וכלים חיצוניים.

  • ניתוח מסמכים ארוכים

    תמיכה מובנית ב־262,144 טוקנים מאפשרת לחפש ולסכם טקסטים כבדים מבלי לחתוך אותם.

  • עוזר קידוד קל משקל

    עם ציון של 76.8 ב־MultiPL-E הוא עובד מצוין לכתיבת סקריפטים מהירה מקומית על מחשב נייד.

איפה זה נופל

למרות השיפור הכללי, יש תחומים שבהם הוא נסוג לאחור. במבחן Aider-Polyglot שבודק עריכת קוד מורכבת על פני פרויקטים הוא מקבל 12.9 בלבד, ירידה מ־13.8 בגרסה הקודמת ונמוך בהרבה מהמודלים הגדולים. גם בבדיקות של סוכנים בתחום הטלקום הוא ירד ל־13.2 לעומת 17.5 בעבר.

בנוסף, הכרטיס מזהיר שהגדרת presence penalty מעל האפס כדי למנוע חזרתיות עלולה לגרום לערבוב שפות ולפגוע באיכות הפלט. מי שבונה עליו לשיחות רב לשוניות מורכבות בעברית יצטרך לבדוק היטב שהוא לא זורק מילים באנגלית באמצע משפט.

שאלות
נפוצות

האם אני צריך להגדיר משהו כדי לכבות את בלוק החשיבה?

לא. הדגם הזה אומן מראש לעבוד ללא בלוקי חשיבה, והוא מחזיר ישירות את התשובה הסופית. אין צורך להעביר דגלים כמו enable_thinking בפנייה למודל.

למה המודל זורק שגיאת זיכרון למרות שהוא שוקל מעט?

המודל עצמו קטן, אבל חלון ההקשר שלו מגיע ל־256K טוקנים. פתיחה של הקשר מלא כזה תופסת נפח עצום בזיכרון ה־VRAM, ולכן אם אין לכם חומרה כבדה עדיף להגביל את ההקשר בהגדרות ההרצה ל־32K.

איך מריצים

את קבצי ה־GGUF האלה מריצים ישירות בתוכנות מקומיות כמו Ollama, LMStudio או llama.cpp, וספריות שרת כמו vLLM ו־SGLang תומכות בו ישירות. כדי לטעון אותו לא צריך מפלצת מחשוב, וכרטיס מסך בודד של 8 עד 12 גיגה זיכרון יספיק לרוב הגרסאות המכווצות בעומס עבודה רגיל.

הבעיה מתחילה כשמנסים לנצל את כל חלון ההקשר של ה־256K. שמירה של מידע כל כך ארוך בזיכרון ה־KV דורשת המון RAM, ואם תנסו לדחוף מסמכי ענק בחומרה ביתית תקבלו שגיאת זיכרון מיד. במקרים של עומס טוקנים כזה, שווה לשקול הרצה על שרת ייעודי או הגבלה של ההקשר ל־32,768 טוקנים כפי שממליצים המפתחים.

ollama run hf.co/unsloth/Qwen3-4B-Instruct-2507-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זה רישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים, ושילוב במוצרים פנימיים או חיצוניים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצים שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗