GPT
Q

Qwen3-4B

קוד פתוח

Qwenapache-2.02025-04-27

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל שפה קומפקטי שמביא יכולות חשיבה ופתרון בעיות לקצה, עם מעבר מובנה בין מצב היגיון ממושך לשיחה מהירה בלי להחליף משקלים.

  • 4Bפרמטרים
  • 40,960טוקנים בהקשר
  • 7.5 GBמשקל הקבצים
  • 6,283,681הורדות בחודש

מה זה

במשקל של כארבעה מיליארד פרמטרים, המודל הזה מתמקד בשינוי התנהגותי מעניין: היכולת לעבור בזמן ריצה בין מצב חשיבה מפורט לבין מצב תגובה רגיל. במצב החשיבה הוא מייצר בלוק היגיון שמסייע במתמטיקה, כתיבת קוד ומשימות מורכבות, בעוד שבמצב הרגיל הוא מדלג על השלב הזה ומחזיר טקסט ישיר.

הוא מאומן מראש וכולל התאמות להעדפות אנושיות, שיחה מרובת תורות והפעלת כלים חיצוניים במבנה סוכנים. עם תמיכה מוצהרת במעל למאה שפות ואפשרות הרחבת הקשר עד 131,072 טוקנים באמצעות מנגנון יעודי, מדובר בניסיון לדחוס התנהגות של מודלים גדולים בהרבה לתוך מעטפת פיזית קטנה מאוד.

מתאים ל

  • סוכן אוטונומי מקומי

    חיבור לכלים חיצוניים על חומרה ביתית, תוך שימוש במצב חשיבה לפירוק בעיות מורכבות לקריאות מתאימות.

  • עוזר שיחה מהיר במכשיר קצה

    כיבוי מצב החשיבה מאפשר קבלת מענה שוטף ודל שיהוי לשיחה רב־לשונית בלי לתפוס משאבי מחשוב כבדים.

  • ניתוח מסמכים בינוניים

    עיבוד טקסטים של עד עשרות אלפי טוקנים בעלויות תשתית נמוכות ובמהירות הפקה גבוהה.

איפה זה נופל

הבעיה הבולטת ביותר היא הנטייה לחזרות אינסופיות בלולאות פלט. היצרן עצמו ממליץ במפורש לא להשתמש בחיפוש חמדני, ולעיתים קרובות תצטרכו להפעיל קנס נוכחות כדי לרסן אותו. תוספת הקנס הזו עלולה להוביל לתופעות לוואי כמו ערבוב שפות באותו מענה ופגיעה באיכות הכוללת. בנוסף, הרחבת ההקשר באמצעות הגדרה סטטית פוגעת ישירות בביצועים של שאילתות קצרות, כך שצריך לנהל את הטווחים בזהירות.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מחליטים אם המודל יציג את תהליך החשיבה שלו?

השליטה נעשית ברמת ה־API באמצעות פרמטר ייעודי או בהזנת תגיות מיוחדות בטקסט הקלט. כאשר המצב מופעל, ההסבר נוצר בתוך בלוק תחום לפני התשובה הסופית, וכאשר הוא מכובה, הפלט מגיע מיד ללא שלב ביניים.

האם יש בעיה לשמור את תהליך החשיבה בהיסטוריית השיחה?

כן. ההנחיה היא לנקות את בלוק החשיבה מהזיכרון ולהחזיר להיסטוריית השיחה הבאה רק את הפלט הסופי. השארת שלבי החשיבה המוקדמים בתוך הפרומפטים הבאים מבלבלת את המענה ואינה נתמכת היטב.

מה קורה אם מריצים אותו על ספריות ישנות?

גרסאות של ספריית transformers הישנות מ־4.51.0 אינן מזהות את הארכיטקטורה של המודל ויקרסו מיד עם שגיאת מפתח. יש לעדכן את סביבת הפייתון לפני שטוענים את המשקלים למערכת.

איך מריצים

המשקלים שוקלים 7.5 גיגה בייט בפורמט המקורי, מה שאומר שאפשר להריץ אותו בקלות על כרטיס מסך ביתי בודד עם 12 או 16 גיגה זיכרון, או על מעבדי מחשבים אישיים בכלים כמו llama.cpp ו־Ollama. לסביבות שרת, vLLM ו־SGLang תומכים בו ישירות עם פענוח החשיבה, אך חובה לוודא שגרסת ספריית transformers היא לפחות 4.51.0 כדי לא להיתקל בשגיאות מפתח.

אם היישום שלכם דורש הקשר מלא של מעל 32,768 טוקנים באופן קבוע, כדאי לשקול קריאה לשירות ענן מנוהל שתומך במנגנון הרחבה דינמי. הרצה מקומית עם מנגנון הרחבה סטטי דורשת הגדרות פרמטרים ידניות ועלולה לפגוע בדיוק הטקסטים הקצרים.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-4B")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המוכר. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים פנימיים או סגורים, כל עוד שומרים על הודעות זכויות היוצרים וכתב הוויתור על האחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗