GPT
Q

Qwen3-30B-A3B-Instruct-2507-FP8

קוד פתוח

Qwenapache-2.02025-07-28

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

זה מודל MoE דחוס בכימות FP8 שמשלב 30.5 מיליארד פרמטרים ומפעיל רק 3.3 מיליארד בכל טוקן. מקבלים ביצועי שיחה וקוד גבוהים בלי להזדקק לחוות שרתים ענקית כדי לקבל מענה מהיר.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 29.1 GBמשקל הקבצים
  • 744,535הורדות בחודש

מה זה

במקום לחשב את כל המשקלים בכל מילה, הארכיטקטורה הזו מנתבת כל טוקן לשמונה מומחים מתוך 128. בפועל אתם מקבלים מהירות חישוב של מודל קטן עם מאגר הידע של מודל בינוני, יחד עם חלון הקשר ענקי של 262,144 טוקנים.

במבחני ביצועים הוא עוקף את הדור הקודם שלו בפער ניכר, בעיקר בהיגיון ומעקב אחר הוראות. ב־ZebraLogic הוא מגיע ל־90 נקודות, ובמבחני כתיבה והעדפת משתמש כמו Arena-Hard v2 הוא מזנק ל־69 לעומת פחות מ־25 בגרסה המקורית. המודל מוגדר מראש לעבודה ישירה בלי תגיות חשיבה ארוכות, כך שהוא פולט תשובות מיידיות בלי לבזבז זמן על שרשראות מחשבה נפרדות.

מתאים ל

  • סוכן תמיכה ומענה לפניות

    מצטיין במעקב אחרי הוראות מדויקות ובכתיבה טבעית עם ציון 84.7 ב־IFEval, בלי לייצר זמני המתנה ארוכים.

  • קריאת מסמכים טכניים ארוכים

    תומך בקונטקסט של 262,144 טוקנים ומאפשר תשאול קבצים שלמים במכה אחת, בתנאי שהשרת הוגדר עם מספיק זיכרון.

  • הפעלת כלים ופונקציות

    מיועד להשתלב בתוך סוכני אוטומציה עם תמיכה מובנית בחיבור כלים, ומתאים לעבודה ישירה דרך ספריות כמו Qwen-Agent.

איפה זה נופל

המודל חלש משמעותית במשימות עריכת קוד מורכבות במאגרים קיימים, עם תוצאה של 35.6 בלבד ב־Aider-Polyglot, הרחק מאחורי חלופות קנייניות וגרסאות גדולות יותר. בבדיקות של סוכנים בתחום הטלקום, TAU2-Telecom, הוא קרס ל־12.3 נקודות.

מעבר לכך, הכרטיס מזהיר שהעלאת presence_penalty מעל אפס כדי למנוע חזרתיות עלולה לגרום לערבוב שפות ולפגוע באיכות הפלט, נושא רגיש במיוחד בעבודה עם עברית ושפות שאינן אנגלית.

אותה משפחה

Qwen3-30B-A3B-Instruct-2507 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מציג את תהליך החשיבה שלו לפני מתן תשובה?

לא. זו גרסה ייעודית שרצה רק במצב ללא חשיבה, ולכן היא לא תייצר בלוקים של think בפלט. זה חוסך זמן יקר ומאפשר לקבל את התשובה הסופית ישירות.

אפשר להריץ אותו על גרסאות ישנות של transformers?

אי אפשר. שימוש בגרסה נמוכה מ־4.51.0 ייכשל מיד בשגיאת חוסר זיהוי של הארכיטקטורה. חובה לעדכן את החבילה לפני הטעינה.

האם כדאי להגדיר לו context length מקסימלי בשרת?

רק אם יש לכם מספיק VRAM. פתיחה של 262,144 טוקנים דורשת זיכרון עצום ל־KV Cache, ואם הכרטיס מוגבל עדיף להגדיר תקרה של 32,768 כדי למנוע קריסות.

איך מריצים

המשקלים שוקלים 29.1 ג'יגה־בייט בכימות FP8 מובנה עם בלוקים של 128. כדי להחזיק אותו בזיכרון של כרטיס בודד יחד עם חלון הקשר מלא של 256K, כרטיס של 48GB או שילוב של שני כרטיסים יהיו הכרחיים. אם תנסו לטעון אותו על 32GB תצטרכו לחתוך את חלון ההקשר משמעותית לכיוון 32K כדי להימנע מנפילות זיכרון.

אפשר להרים אותו מקומית עם vLLM מגרסה 0.8.5 ומעלה או SGLang, וכמובן ספריות מקומיות כמו Ollama ו־LMStudio. שרת מקומי שווה את ההשקעה אם יש לכם צורך בעיבוד כמויות מידע פנימיות ורציפות, אבל לפניות בודדות עלויות החומרה והתחזוקה יקרות בהרבה מפנייה פשוטה לשרת חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-30B-A3B-Instruct-2507-FP8")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון חופשי לחלוטין ומתיר שימוש מסחרי, שינוי קוד והפצה פנימית או מסחרית במוצר, בלי תמלוגים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים המקורית וציון השינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗