GPT
Q

Qwen3-30B-A3B-FP8

קוד פתוח

Qwenapache-2.02025-04-28

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל תערובת מומחים בכימות FP8 שמשלב חשיבה מעמיקה ומענה מהיר באותו משקל. הוא מפעיל רק 3.3 מיליארד פרמטרים בכל טוקן, כך שמקבלים ביצועים חזקים בחצי מעלות החישוב הרגילה.

  • 31Bפרמטרים
  • 40,960טוקנים בהקשר
  • 30.2 GBמשקל הקבצים
  • 96,355הורדות בחודש

מה זה

מדובר בארכיטקטורת MoE עם 128 מומחים סך הכול, שמתוכם המערכת מנתבת ל־8 בלבד בזמן אמת. מתוך 30.5 מיליארד פרמטרים כוללים, רק 3.3 מיליארד פעילים בכל רגע נתון. הטריק המרכזי כאן הוא היכולת לדלג בין מצב חשיבה של שרשרת היסק למצב שיחה רגיל ומהיר, ואפשר לשלוט בזה דרך הטמפלייט או ישירות בפרומפט עם פקודות כמו think ו־no_think.

הגרסה הזו מגיעה מכומתת ב־FP8 ישירות מהיוצרים עם בלוקים של 128. לפי כרטיס המודל, בחישובים, קוד והפעלת כלים חיצוניים במבנה סוכן, הוא עוקף את הדורות הקודמים של QwQ ו־Qwen2.5, כשהוא שומר על יכולת שפתית במעל מאה שפות.

מתאים ל

  • סוכנים אוטונומיים

    חיבור כלים דרך פרוטוקול MCP ותמיכה מובנית בפירוק משימות היסק מורכבות.

  • בוטים לתמיכה טכנית

    מעבר גמיש למצב ללא חשיבה מייצר מענה מהיר וחסכוני בשאילתות פשוטות.

  • ניתוח מסמכים טכניים

    יכולת הרחבה עד 131,072 טוקנים מאפשרת עיבוד מסמכי קוד ומפרטים ארוכים.

איפה זה נופל

אסור להשתמש בפיענוח מסוג greedy decoding כשמצב החשיבה דולק, כי המודל ייכנס ללולאות אינסופיות של חזרות ויפגע קשות בפלט. אם מגדילים את עונש החזרתיות כדי למנוע את התופעה הזו, היצרן מזהיר שהמודל עלול להתחיל לערבב שפות באמצע התשובה.

חלון ההקשר הטבעי עומד על 32,768 טוקנים, ולמרות שאפשר להרחיב אותו ל־131,072 באמצעות YaRN, מדובר בהרחבה סטטית ברוב המנועים בקוד פתוח. הפעלת ההרחבה הזו פוגעת באופן מורגש באיכות המענה בטקסטים קצרים, ולכן לא כדאי להפעיל אותה כברירת מחדל אלא אם אתם באמת קוראים מסמכי ענק.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם כדאי להשאיר את מצב החשיבה דולק תמיד?

לא. במשימות שיחה פשוטות, תרגום או שליפת מידע קצרה, מצב החשיבה סתם יבזבז טוקנים ויאריך את זמן ההמתנה למענה. מומלץ לכבות אותו ולהדליק רק כשפותרים בעיות לוגיקה, מתמטיקה ותכנות.

איך מטפלים בהיסטוריית השיחה כשהמודל חושב?

הכרטיס ממליץ מפורשות לחתוך את בלוק ה־think מההיסטוריה שנשלחת חזרה למודל בסיבוב הבא. יש לשמור רק את התשובה הסופית, אחרת הביצועים והעקביות של השיחה נפגעים.

איך מריצים

המשקל יושב על 30.2 גיגה בייט, מה שאומר שאתם חייבים כרטיס מסך מודרני שתומך בחישובי FP8 טבעיים עם לפחות 40 עד 48 גיגה של זיכרון וידאו, כמו A100 או כרטיסים מקבילים, אם אתם רוצים להחזיק גם את המודל וגם את הזיכרון לחלון הקשר סביר. אם אתם עובדים בסביבה מקומית קטנה יותר עם כרטיסי צרכנים בודדים, עדיף להמיר לגרסאות GGUF דרך llama.cpp או לפנות ישירות לשרתי API.

בפריסה עצמאית משתמשים במנועים כמו vLLM מגרסה 0.8.5 ומעלה או SGLang מגרסה 0.4.6.post1. שימו לב שבספריית transformers הרגילה דרושה גרסה 4.51.0 ומעלה כדי לא להיתקל בשגיאות זיהוי של הארכיטקטורה, ובריצה מבוזרת מרובת כרטיסים תחת transformers צריך להגדיר את משתנה הסביבה CUDA_LAUNCH_BLOCKING בגלל בעיות ידועות בכימות.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-30B-A3B-FP8")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי חופשי, שינוי של המשקלים, הפצה ושילוב במוצרים פרטיים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗