GPT
Q

Qwen3-4B-Thinking-2507

קוד פתוח

Qwenapache-2.02025-08-05

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל פתוח וקומפקטי של 4 מיליארד פרמטרים שמתמקד בהסקה לוגית מאומצת, ומציג תוצאות מפתיעות במתמטיקה ותכנות לצד חלון ענק של 256K טוקנים.

  • 4Bפרמטרים
  • 262,144טוקנים בהקשר
  • 7.5 GBמשקל הקבצים
  • 353,550הורדות בחודש

מה זה

מדובר בעדכון ממוקד למודל הנימוק של Qwen, שתוכנן מראש לחשוב בצורה עמוקה וארוכה לפני שהוא עונה. הייחוד העיקרי שלו הוא יכולת הסקה לוגית שמנצחת מודלים גדולים ממנו בהרבה, יחד עם חלון הקשר טבעי של 262,144 טוקנים. במבחן המתמטיקה התחרותית AIME25 הוא מגיע לציון של 81.3, ובמבחן GPQA לתואר שני הוא מגיע ל־65.8, תוצאות שמשתוות ואף עוקפות את גרסת ה־30B המקבילה.

בנוסף לחשיבה מתמטית וקוד, המודל מיועד להפעלת סוכנים וקריאה לכלים חיצוניים, תחום שבו הוא מציג זינוק של עשרות אחוזים לעומת הגרסה הקודמת שלו. הנתונים מראים קפיצה ברורה גם במבחני מעקב אחרי הוראות מורכבות כמו IFEval, מה שהופך מודל במשקל 7.5 גיגה־בייט לכלי פיתוח מעשי ביותר.

מתאים ל

  • פתרון בעיות מתמטיות

    משיג ציון של 81.3 במבחן AIME25 בזכות שרשראות חשיבה מעמיקות במיוחד.

  • סוכן לקריאת כלים אוטונומית

    מיועד להשתלב מול מערכות הפעלה וכלים חיצוניים לפי מבחני סוכנים כמו BFCL ו־TAU.

  • ניתוח מסמכים טכניים ארוכים

    מציע חלון של 262,144 טוקנים לטעינת בסיסי קוד או מפרטים שלמים במכה.

איפה זה נופל

החיסרון הבולט ביותר הוא חוסר הגמישות במצב העבודה. הוא תומך אך ורק במצב חשיבה, תבנית השיחה כופה עליו בלוק מחשבה באופן קבוע, ואי אפשר לבטל את זה כדי לקבל תשובה מהירה וזולה. בנוסף, הוא נוטה למשוך פלטים ארוכים מאוד שדורשים הקצאת עשרות אלפי טוקנים, מה שמאט את זמן התגובה. אם מנסים להשתמש בו בשיחה מתמשכת, חובה לנקות את בלוקי החשיבה מההיסטוריה כדי לא לפגוע באיכות התשובות, והעלאת מקדם הענישה על חזרתיות עלולה לגרום לו לערבב שפות.

אותה משפחה

Qwen3-4B-Thinking-2507 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו בלי שרשרת החשיבה הארוכה?

לא. המודל תוכנן לעבוד אך ורק במצב חשיבה והתבנית שלו מפעילה בלוק כזה באופן מובנה. אם אתם צריכים תשובות מהירות של שורה אחת, תבזבזו כאן זמן חישוב יקר וטוקנים מיותרים.

למה התשובה שלי מתחילה ישר בלי תגית פתיחה של מחשבה?

תבנית הצ'אט של המודל מכניסה את תגית הפתיחה של החשיבה מראש כחלק מהפרומפט שנשלח למודל. לכן הפלט שתקבלו בפועל יכיל רק את תוכן החשיבה ותגית סגירה, וזה תקין לחלוטין לפי התיעוד.

איך צריך לנהל איתו שיחות מרובות שלבים?

חובה לחתוך את תוכן החשיבה מתוך ההיסטוריה שמוחזרת למודל בשלבים הבאים של השיחה, ולהשאיר רק את התשובה הסופית. אם תשאירו את שלבי החשיבה הקודמים בהיסטוריה, איכות התגובות הבאות תיפגע.

איך מריצים

המודל שוקל 7.5 גיגה־בייט בדיוק bfloat16, כך שכרטיס מסך בודד עם 16 או 24 גיגה־בייט זיכרון יספיק להרצה בסיסית. הבעיה האמיתית מתחילה כשרותמים את מלוא חלון ההקשר, שמגיע ל־256K, לצד פלטים מומלצים של עשרות אלפי טוקנים. במצב כזה תצטרכו להקצות זיכרון משמעותי עבור מטמון ה־KV, או להגביל את ההקשר בעזרת הפרמטרים בשרתי הסקה.

בפועל אפשר להרים אותו מקומית עם כלים מוכרים כמו Ollama, LMStudio, llama.cpp, או להרים שרת ייעודי בעזרת vLLM או SGLang. אם חסרה לכם חומרת שרת מתאימה ומחפשים קריאות עם הקשר מלא של מעל 131 אלף טוקנים בלי לקבל שגיאות זיכרון, עדיף להשתמש בנקודת קצה מנוהלת.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-4B-Thinking-2507")
print(pipe("שלום"))

הרישיון

המודל משוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני לחלוטין שמאפשר שימוש מסחרי, שינוי הקוד והמשקלים, הפצה ושילוב במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗