GPT
Q

Qwen3-8B

קוד פתוח

Qwenapache-2.02025-04-27

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת 8.2 מיליארד פרמטרים שמשלבת יכולות חשיבה עמוקה ושיחה רגילה באותו קובץ. היא מתאימה למי שצריך מודל קומפקטי שמסוגל לפתור לוגיקה מורכבת וקוד בלי להחזיק שרת ענק.

  • 8.2Bפרמטרים
  • 40,960טוקנים בהקשר
  • 15.3 GBמשקל הקבצים
  • 13,046,829הורדות בחודש

מה זה

מדובר במודל שפה צפוף מבוסס ארכיטקטורת Qwen3ForCausalLM עם 36 שכבות, שנועד למשימות יצירת טקסט, כתיבת קוד והפעלת כלים חיצוניים. החידוש העיקרי כאן הוא מנגנון החלפה פנימי בין מצב חשיבה למצב רגיל. במקום להחזיק מודל ייעודי להסקה לוגית כמו סדרת QwQ ומודל נפרד לשיחה מהירה כמו Qwen2.5, אותו משקל מנהל את שניהם לפי דגל בטמפלייט או פקודה בפרומפט.

הוא מציע חלון הקשר בסיסי של 32,768 טוקנים שתומך בהרחבה עד 131,072 באמצעות YaRN, ומאומן על יותר ממאה שפות ודיאלקטים. בתוך הקטגוריה של שמונה מיליארד פרמטרים, הדגש כאן הוא על שילוב בין תמיכה בסוכנים חכמים לבין שרשראות חשיבה סגורות בתגיות ייעודיות, בלי צורך בתשתית מפוצלת.

מתאים ל

  • פתרון בעיות מתמטיקה וקוד

    מצב החשיבה מייצר שרשרת הסקה פנימית עמוקה לפני מתן הפלט הסופי לבעיות מורכבות.

  • בוטים ושיחה קלת משקל

    כיבוי מצב החשיבה מייצר תשובות קצרות ומהירות בלי לבזבז זמן וטוקנים על שלבי ביניים.

  • הפעלת כלים וסוכני אוטונומיה

    הארכיטקטורה כוללת התאמה מובנית לשילוב כלי MCP וקריאות לפונקציות חיצוניות.

איפה זה נופל

אסור להשתמש בפיענוח חמדן (Greedy decoding) במצב חשיבה, כי המודל נכנס ללולאות אינסופיות של חזרות ומאבד ביצועים. כדי להילחם בחזרות האלה הכרטיס מציע להעלות את מקדם הענישה, אבל מזהיר שזה עלול לגרום לערבוב שפות ולפגוע באיכות התשובה. בנוסף, הפעלת YaRN מורידה את הביצועים בטקסטים קצרים, כך שאי אפשר פשוט להשאיר אותה דולקת תמיד. בשיחות מרובות שלבים אתם חייבים לנקות ידנית את בלוקי החשיבה מההיסטוריה, אחרת ההקשר מתנפח ואיכות השיחה מתדרדרת.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מכבים את פלט המחשבות בתוך התשובה?

אפשר להגדיר את הפרמטר enable_thinking לערך False בעת בניית הפרומפט בטמפלייט, או לשלוח את התגית no_think בתוך הודעת המשתמש. במצב כזה המודל יפעל ישירות כמו גרסאות שיחה רגילות ולא ייצר בלוקי חשיבה.

איך מרחיבים את ההקשר מעבר ל־32 אלף טוקנים?

צריך להגדיר מנגנון YaRN עם מקדם התאמה של 4.0 בקובץ ההגדרות או ישירות בפקודת ההרצה של השרת. לא כדאי להפעיל את זה כשלא צריך, כי ההרחבה פוגעת בדיוק של טקסטים קצרים.

איך מריצים

המשקל המלא של הקבצים עומד על 15.3 גיגה בייט בדיוק bfloat16, כך שצריך כרטיס מסך יחיד עם לפחות 24 גיגה בייט זיכרון כדי לטעון אותו ולהשאיר מקום להקשר סביר. אם משתמשים בכלים כמו llama.cpp או Ollama בגרסאות מכווצות, אפשר להריץ אותו גם על חומרה צרכנית חלשה יותר או מחשבי אפל עם זיכרון אחוד. שימו לב שחובה לעבוד עם transformers מגרסה 4.51.0 ומעלה כדי לא להיתקל בשגיאות זיהוי ארכיטקטורה.

לסביבות שרת מומלץ להרים נקודת קצה דרך vLLM מגרסה 0.8.5 או SGLang מגרסה 0.4.6 ומעלה, שכוללות תמיכה מובנית בפירוק בלוקי החשיבה. אם חלון ההקשר שלכם מגיע באופן קבוע לקצה של 131 אלף טוקנים, תצטרכו להוסיף כרטיסי מסך נוספים בשביל טבלת ה־KV, ובמצב כזה שירות מנוהל חיצוני כבר יהיה זול ופשוט יותר לתחזוקה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-8B")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי לחלוטין, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הודעות זכויות היוצרים והצהרת הרישיון המקורית. אין חובת שיתוף קוד ואין תמלוגים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗