GPT
Q

Qwen3-4B-Instruct-2507-FP8

קוד פתוח

Qwenapache-2.02025-08-06

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת הוראות מכווצת ומהירה שמגיעה עם חלון הקשר של 256 אלף טוקנים. פתרון קל משקל שמתאים למי שרוצה להריץ סוכן מקומי בלי לחכות לשרשראות חשיבה ארוכות.

  • 4.4Bפרמטרים
  • 262,144טוקנים בהקשר
  • 4.8 GBמשקל הקבצים
  • 1,100,660הורדות בחודש

מה זה

מדובר בעדכון לגרסת 4 מיליארד הפרמטרים בסדרת Qwen3, שמגיע מכווץ ישירות לדיוק FP8 עם חלוקה לבלוקים של 128. הוא עובד במצב ישיר בלבד, כלומר הוא לא מייצר בלוקים של חשיבה פנימית ופולט את התשובה מיד. שילוב של 36 שכבות וארכיטקטורת תשומת לב מסוג GQA עם 8 ראשי מפתח וערך מאפשר לו לטפל בהקשרים ארוכים ביעילות יחסית לגודלו.

במבחני הביצועים הדגם מציג זינוק חריג יחסית למשקל שלו. במבחן הלוגיקה ZebraLogic הוא קפץ לציון 80.2 לעומת 35.2 בגרסה הקודמת, ובמתמטיקה של AIME25 הגיע ל־47.4 לעומת 19.1. גם במשימות של הפעלת כלים וסוכנים כמו TAU1 ו־BFCL הוא מציג מספרים גבוהים יותר מגרסת ה־4B המקורית.

מתאים ל

  • סוכן מקומי לביצוע פעולות

    מציג ציון 61.9 ב־BFCL ומותאם ישירות לתקשורת מול כלים חיצוניים דרך תבניות ייעודיות.

  • ניתוח מסמכים ארוכים

    תומך בקריאת טקסטים עד 256 אלף טוקנים ישירות מהזיכרון בלי לפצל קבצים.

  • עוזר שיחה מהיר במכשיר קצה

    עובד ללא מצב חשיבה שמעכב את הפלט ותופס רק 4.8 גיגה בייט זיכרון.

איפה זה נופל

המודל חלש בתרחישים מסוימים של תכנות וסוכנים מורכבים. במבחן הקוד Aider-Polyglot הוא קיבל רק 12.9, שזה פחות אפילו מגרסת ה־4B הקודמת שקיבלה 13.8, וציון 13.2 במבחן הסוכנים TAU2-Telecom. בנוסף, המסמכים מזהירים שהעלאת ערך ה־presence penalty מעל אפס כדי למנוע חזרתיות עלולה לגרום לו לערבב שפות באמצע הפלט.

אותה משפחה

Qwen3-4B-Instruct-2507 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה המודל לא מציג את תגיות החשיבה שהוא אמור לייצר?

הגרסה הזו נבנתה לפעול במצב ללא חשיבה בלבד. היא לא מייצרת בלוקים מסוג think, ואין צורך להגדיר לה פרמטרים מיוחדים כדי לכבות את המנגנון הזה.

מה לעשות אם המנוע קורס בגלל חוסר בזיכרון וידאו?

הקריסה מתרחשת בדרך כלל בגלל גודל חלון ההקשר המלא. מומלץ להגביל בהגדרות ההרצה של vLLM או SGLang את אורך ההקשר המקסימלי ל־32,768 טוקנים כדי לפנות מקום בזיכרון.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.8 גיגה בייט, כך שאפשר להריץ אותו בקלות על כרטיס מסך בודד עם 8 עד 12 גיגה בייט זיכרון. מנועים כמו vLLM מגרסה 0.8.5 או SGLang מגרסה 0.4.6.post1 תומכים בו ישר מהקופסה, וספריית transformers דורשת גרסה 4.51.0 ומעלה כדי לזהות את הארכיטקטורה.

המלכוד המרכזי מגיע כשמנסים לנצל את כל 262,144 הטוקנים של ההקשר. טבלאות ה־KV באורך כזה דורשות זיכרון וידאו עצום שיגרום לקריסת זיכרון מהירה בכרטיסים ביתיים, ולכן אם אין לכם חומרה ייעודית תצטרכו להגביל את ההקשר ל־32 אלף טוקנים בשרת המקומי.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-4B-Instruct-2507-FP8")
print(pipe("שלום"))

הרישיון

הפצה תחת רישיון Apache 2.0 המלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו במוצרים סגורים ולהפיץ עותקים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗