GPT
Q

Qwen3-4B-Thinking-2507-FP8

קוד פתוח

Qwenapache-2.02025-08-06

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל קומפקטי של 4.4 מיליארד פרמטרים שמיועד נטו לחשיבה ולפתרון בעיות מורכבות. הוא נדחס מראש ל־FP8 כדי לתת ביצועי הסקה חזקים בלי לבלוע משאבי שרת חריגים.

  • 4.4Bפרמטרים
  • 262,144טוקנים בהקשר
  • 4.8 GBמשקל הקבצים
  • 10,280הורדות בחודש

מה זה

הגרסה הזו מתמקדת כל כולה בהסקה מעמיקה ובמשימות חישוביות, בלי אפשרות לכבות את שרשרת המחשבה. היא מחזיקה חלון הקשר מקורי של 262,144 טוקנים, נתון נדיר מאוד לגודל פיזי קטן כזה, מה שמאפשר להזין תיעוד טכני נרחב או קוד שלם בלי לאבד פוקוס במהירות.

במבחני הביצועים הוא מציג זינוק חד מול גרסאות קודמות באותו הגודל. במבחן המתמטי AIME25 הוא מגיע לציון של 81.3 לעומת 65.6 בגרסה הקודמת, ובמבחן ההוראות המורכבות IFEval הוא מגיע ל־87.4, ציון שעוקף אפילו את גרסת ה־30B Thinking המקבילה בטבלה. ביכולות הפעלת כלים וסוכנים כמו TAU2-Airline הוא קופץ מ־28.0 ל־58.0, מה שהופך אותו למועמד ממשי לאוטומציות שדורשות החלטות רב־שלביות.

מתאים ל

  • פתרון בעיות מתמטיקה וקוד

    הוא משיג 81.3 ב־AIME25 ו־1852 ב־CFEval, כך שהוא מצטיין בפירוק משימות אלגוריתמיות לשלבים.

  • הפעלת כלים וממשקי API

    הוא מקבל ציון של 71.2 ב־BFCL-v3 ומתוכנן לעבודה עם סוכנים חכמים וקריאות לפונקציות חיצוניות.

  • ניתוח מסמכי ענק

    חלון הקשר של 262,144 טוקנים מאפשר להזין פרויקטים שלמים או מסמכים משפטיים ולחלץ מהם תובנות.

איפה זה נופל

המודל הזה עובד אך ורק במצב חשיבה. אי אפשר לבקש ממנו תשובות מהירות או קצרות בלי לעבור דרך שרשרת מחשבה ארוכה, והוא מייצר אלפי טוקנים לפני שהוא פולט את התשובה הסופית. כדי שהוא יפתור בעיות מורכבות, היוצרים ממליצים להקצות תקרת פלט של עד 81,920 טוקנים, מה שגוזל זמן יקר ומעמיס על החומרה. בנוסף, אם מגדילים את עונש החזרתיות presence_penalty כדי למנוע לולאות טקסט, יש סיכון לערבוב שפות ולירידה בביצועים.

אותה משפחה

Qwen3-4B-Thinking-2507 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לבטל את שלב החשיבה כדי לקבל תשובות מהירות?

לא. המודל פועל אך ורק במצב חשיבה, ותבנית השיחה מוסיפה את תגית המחשבה כברירת מחדל קבועה.

איזו גרסת תוכנה צריך בשביל להריץ אותו?

בספריית transformers חובה לעבוד עם גרסה 4.51.0 ומעלה כדי להימנע משגיאת KeyError, וב־vLLM מגרסה 0.8.5 ומעלה.

כמה זיכרון דרוש בהרצה מלאה של ההקשר?

המשקל נטו הוא 4.8 גיגה בייט, אבל שמירה על חלון של 256K דורשת עשרות גיגה נוספים עבור זיכרון ההקשר, ולכן עדיף לקצץ אותו אם מופיעות שגיאות זיכרון.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.8 גיגה בייט בלבד בזכות קוונטיזציית FP8 מובנית עם גודל בלוק של 128. כרטיס מסך בודד עם 8 או 16 גיגה זיכרון יריץ אותו בקלות, אבל כדי לנצל את מלוא חלון ההקשר תצטרכו זיכרון נדיב בהרבה לטובת ה־KV cache, או שתאלצו לקצץ את ההקשר בעת ההרצה.

אפשר לטעון אותו ישירות דרך transformers מגרסה 4.51.0 ומעלה כדי לא להיתקל בשגיאות, או להרים שרת באמצעות vLLM מגרסה 0.8.5 ומעלה ו־SGLang עם מפענח deepseek-r1. לשימוש מקומי הוא עובד עם כלים מוכרים כמו Ollama ו־llama.cpp.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-4B-Thinking-2507-FP8")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי קוד והפצה של המודל בתוך מערכות סגורות או פתוחות. התנאי היחיד הוא שמירה על זכויות היוצרים המקוריות ומתן קרדיט כנדרש ברישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗