GPT
Q

Qwen3-4B-GGUF

קוד פתוח

unslothapache-2.02025-04-28

  • transformers
  • gguf
  • qwen3
  • text-generation
  • qwen

גרסת GGUF למודל של 4 מיליארד פרמטרים שמשלבת יכולת חשיבה והפעלת כלים. היא מתאימה למי שרוצה להריץ לוקאלית מודל קל עם תמיכה בהקשר ארוך.

  • 40,960טוקנים בהקשר
  • 63.2 GBמשקל הקבצים
  • 498,818הורדות בחודש
  • 240לייקים

מה זה

מדובר במודל שפיתחה עליבאבא ועבר המרה לקובצי GGUF על ידי unsloth. הייחוד המרכזי שלו הוא היכולת לעבור בין מצב חשיבה מעמיק, שבו הוא מייצר שרשרת מחשבה מפורטת בתוך תגיות ייעודיות עבור בעיות לוגיקה, קוד ומתמטיקה, לבין מצב שיחה רגיל ומהיר ללא תגיות חשיבה. המעבר מתבצע פשוט על ידי שליחת פקודות כמו think או no_think בהודעות, בלי צורך להחליף מודל או לטעון משקלים אחרים.

הוא כולל ארכיטקטורה של 36 שכבות עם מנגנון Grouped Query Attention שמייעל את צריכת הזיכרון. למרות הגודל הצנוע, הוא תומך בהפעלת כלים חיצוניים וסוכנים אוטונומיים באמצעות תבניות ייעודיות, ומציג חלון הקשר טבעי של 32,768 טוקנים שמוגדר בקובצי ההגדרה ל־40,960 טוקנים כדי להשאיר מרווח לקלט ולפלט ארוכים.

מתאים ל

  • פתרון בעיות מתמטיקה וקוד

    מצב החשיבה מאפשר לו לתכנן שלבי פתרון מורכבים לפני פליטת התשובה, בלי להעמיס על החומרה.

  • סוכנים מבוססי כלים מקומיים

    ארכיטקטורת המודל כוללת תמיכה מובנית בקריאה לפונקציות וכלים חיצוניים במסגרות עבודה מקומיות.

  • צ'אט מהיר במשאבים נמוכים

    כיבוי מצב החשיבה מספק מענה מיידי לשיחות שוטפות וצורך מינימום זיכרון וחישוב על מכונות קצה.

איפה זה נופל

המודל רגיש מאוד לפרמטרי דגימה. הכרטיס מזהיר במפורש לא להשתמש ב־greedy decoding במצב חשיבה, כי זה מוביל לחזרות אינסופיות וקריסה בביצועים. במקביל, הפעלת מנגנון YaRN עבור טקסטים ארוכים עלולה לפגוע בדיוק של המודל בטקסטים קצרים, כי המימושים הקיימים משתמשים בפקטור סקיילינג קבוע. הגדלת presence penalty כדי לעצור חזרות עלולה לגרום למודל לערבב שפות באמצע התשובה.

אותה משפחה

Qwen3 יצא ב־10 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך משנים את מצב החשיבה בזמן ריצה מקומית?

אפשר להוסיף את התגיות /think או /no_think ישירות לטקסט של המשתמש בכל הודעה. המודל מזהה את ההוראה האחרונה ועובר בין יצירת בלוק מחשבה מלא לבין מענה ישיר וקצר.

האם כדאי להפעיל את הרחבת ההקשר YaRN כברירת מחדל?

לא. המסמכים מציינים שברירת המחדל של עד 32,768 טוקנים מספיקה לרוב השימושים, והפעלת YaRN מראש תפגע באיכות הפלטים על טקסטים קצרים בגלל סקיילינג סטטי.

איך מריצים

ההרצה המקומית מתבצעת דרך כלים שתומכים בפורמט GGUF כמו llama.cpp או Ollama, או באמצעות vLLM ו־sglang אם מקימים שרת מקומי. המאגר מכיל 32 קבצים במשקל כולל של 63.2 גיגה־בייט שמכילים כנראה מספר דרגות כימות שונות, אבל קובץ בודד של מודל 4B מכומת דורש לרוב גיגה־בייט בודדים של זיכרון ומסוגל לרוץ על כרטיס מסך ביתי בסיסי או מעבד מודרני.

אם יש צורך בהרחבת ההקשר מעבר לטווח הבסיסי, אפשר להשתמש בשיטת YaRN כדי להגיע עד 131,072 טוקנים על ידי הוספת פרמטרים בהפעלת השרת. עבור מערכות פרודקשן עם תעבורה גדולה, קריאה ל־API חיצוני תחסוך את הצורך לנהל את זיכרון ה־KV לבד, במיוחד בחלונות הקשר מקסימליים.

ollama run hf.co/unsloth/Qwen3-4B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים, הפצה ושילוב במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗