GPT
Q

Qwen3-4B-Instruct-2507

קוד פתוח

Qwenapache-2.02025-08-05

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסה מעודכנת למודל בגודל 4 מיליארד פרמטרים שפועלת ישירות בלי בלוקים של חשיבה. הוא מתאים למי שצריך תגובות מהירות עם תמיכה בהקשר של 256 אלף טוקנים על חומרה צנועה.

  • 4Bפרמטרים
  • 262,144טוקנים בהקשר
  • 7.5 GBמשקל הקבצים
  • 3,538,174הורדות בחודש

מה זה

המודל מגיע בארכיטקטורת 36 שכבות עם ארבעה מיליארד פרמטרים ומכוון לעבודה ישירה ללא שרשרת חשיבה מפורשת. הוא מציג שיפור ניכר מול גרסאות קודמות בגודל הזה במתמטיקה ולוגיקה, כמו זינוק במבחן ZebraLogic לציון 80.2 לעומת 35.2 בעבר, וכמעט הכפלה בפתרון שאלות AIME25. במבחני כתיבה והעדפת משתמשים כמו Arena-Hard v2 הוא מגיע לציון 43.4, מה שמצביע על תגובות מלוטשות וטבעיות יותר בטקסט חופשי.

בנוסף ליכולות טקסט רגילות הוא תומך בהפעלת כלים ובפרוטוקול MCP דרך ספריות ייעודיות, ומציג תוצאות טובות במבחני סוכנים כמו TAU1 ו־BFCL-v3. עם זאת, במבחני תכנות מורכבים כמו Aider-Polyglot הוא מקבל ציון נמוך של 12.9, כך שהוא אינו מיועד לתחזוקת מאגרי קוד גדולים.

מתאים ל

  • סוכן שירות לקוחות

    ציונים גבוהים במבחני TAU1 ודיוק בשימוש בכלים מאפשרים לבצע פעולות מוגדרות מול משתמשים במהירות.

  • ניתוח מסמכים ארוכים

    תמיכה מובנית ב־256 אלף טוקנים מאפשרת לקרוא קבצים כבדים בלי לחתוך אותם לחלקים קטנים מראש.

  • כתיבת תוכן ויצירה

    ציונים של מעל 83 במבחני כתיבה יוצרת מבטיחים ניסוחים קולחים במשימות טקסט פתוחות.

איפה זה נופל

החולשה הבולטת ביותר היא שינויים ועריכות קוד במספר קבצים, כפי שמשתקף בנפילה במבחן Aider מול מודלים גדולים יותר. בנוסף, במבחני סוכנים לתחום הטלקום המודל קיבל ציון נמוך של 13.2, ירידה מגרסאות קודמות. שימוש בערך גבוה של presence penalty מעל אפס עלול לגרום לערבוב שפות ולפגיעה בביצועים. כמו כן, אין לו מצב חשיבה מעמיקה ולא תוכלו לקבל ממנו תגיות חשיבה כדי לבקר את שלבי הפתרון.

אותה משפחה

Qwen3-4B-Instruct-2507 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל דורש הפעלה של תגיות חשיבה כדי לתת תשובות מדויקות?

לא. המודל פועל אך ורק במצב ללא חשיבה, ואינו מייצר בלוקים של think. אין צורך להגדיר פרמטרים מיוחדים לביטול החשיבה, הוא פולט מיד את התשובה הסופית.

איך אפשר למנוע שגיאות של חוסר זיכרון בהרצה מקומית?

אם אתם נתקלים בבעיות זיכרון, הגבילו את אורך ההקשר המרבי בהגדרות ההרצה ל־32,768 טוקנים במקום לפתוח את מלוא חלון ה־256 אלף. טעינת כל ההקשר דורשת זיכרון וידאו משמעותי עבור ה־KV cache.

איך מריצים

המשקלים תופסים 7.5 גיגה בייט בפורמט bfloat16, כך שכרטיס מסך בודד עם 12 עד 16 גיגה זיכרון מריץ אותו בקלות. אם אתם מתכוונים לנצל את מלוא חלון ההקשר של 262,144 טוקנים, דרישות הזיכרון לניהול ה־KV cache יזנקו ותצטרכו לקצץ את ההקשר ל־32 אלף כדי למנוע קריסות של חוסר זיכרון.

ההרצה מתבצעת דרך מנועים כמו vLLM מגרסה 0.8.5 או SGLang מגרסה 0.4.6 ומעלה. חובה לעדכן את ספריית transformers לגרסה 4.51.0 לפחות, אחרת תקבלו שגיאה שהארכיטקטורה אינה מוכרת. המודל נתמך גם בכלים מקומיים כמו Ollama ו־llama.cpp.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-4B-Instruct-2507")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או מסחרית במוצר שלכם. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים וצירוף עותק של הרישיון המקורי, בלי חובת פתיחת קוד המקור של המוצר עצמו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗