GPT
Q

Qwen3-30B-A3B-Thinking-2507-FP8

קוד פתוח

Qwenapache-2.02025-07-29

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

זה מודל חשיבה שמפעיל רק 3.3 מיליארד פרמטרים מתוך 30.5 בזמן ריצה, ומביא יכולות פתרון בעיות קשות במחיר חישובי נמוך בהרבה ממודלים מלאים.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 29.1 GBמשקל הקבצים
  • 26,479הורדות בחודש

מה זה

מדובר במודל MoE עם 128 מומחים שבוחר שמונה מתוכם בכל צעד, ומגיע מקוונטט מראש לפורמט FP8. השינוי המרכזי בגרסה הזו מתמקד בהרחבת תהליך המחשבה המובנה, כשהמערכת מייצרת שרשרת חשיבה אוטומטית לפני התשובה הסופית ואי אפשר לכבות את המצב הזה.

במבחני ביצועים בתחום התכנות והמתמטיקה הוא עוקף אפילו את גרסת ה־235B של אותה סדרה, עם 85.0 נקודות ב־AIME25 לעומת 81.5 של הגדול, וציון של 66.0 ב־LiveCodeBench. המשמעות היא שבמשימות אלגוריתמיות וקוד טהור הוא נותן מענה חזק במיוחד לגודל שלו, אף שבמבחני ידע כללי ומדעים מורכבים כמו GPQA המודלים הגדולים עדיין שומרים על יתרון ברור.

מתאים ל

  • פתרון בעיות קוד קשות

    מתאים במיוחד למשימות דיבאגינג ואלגוריתמיקה מורכבת בזכות תוצאות גבוהות ב־LiveCodeBench ותהליך ניתוח מעמיק.

  • הפעלת כלים וסוכנים

    מיועד למערכות אוטומציה מבוססות כלים וקריאות פונקציות, עם שילוב מומלץ בספריית Qwen-Agent.

  • ניתוח מסמכים ארוכים

    תומך בחלון של עד 262,144 טוקנים, מה שמאפשר לעבד טקסטים רחבים בלי לקטוע את ההקשר.

איפה זה נופל

המודל פועל אך ורק במצב חשיבה ולא מסוגל לענות מיד בלי שלב הרהור, מה שמאט את תחילת התשובה ולא מתאים לזמני תגובה מיידיים. המפתחים ממליצים להקצות פלט של עשרות אלפי טוקנים למשימות כבדות, מה שעלול לייקר את הריצה ולגרום לחריגות זיכרון בהקשרים ארוכים. בנוסף, בשיחות מרובות שלבים צריך לנקות ידנית את שלבי החשיבה מההיסטוריה כדי למנוע ירידה בביצועים, והעלאת מדד ה־presence_penalty למניעת חזרות עלולה לגרום לערבוב שפות.

אותה משפחה

Qwen3-30B-A3B-Thinking-2507 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לבטל את תגיות החשיבה כדי לקבל תשובה מהירה?

לא, המודל אומן לפעול אך ורק במצב חשיבה והפרומפט הבסיסי מייצר את פתיחת המחשבה אוטומטית. ניסיון לכפות מענה מיידי יפגע באיכות הפלט ולא נתמך במבנה שלו.

איזו גרסת transformers צריך כדי להריץ את המודל?

חובה לעבוד עם transformers מגרסה 4.51.0 ומעלה. גרסאות ישנות יותר ייכשלו בעלייה עם שגיאת KeyError עבור הארכיטקטורה qwen3_moe.

איך מריצים

המשקל הכולל של הקבצים עומד על 29.1 ג'יגה בייט ב־FP8, כך שכדי להריץ אותו מקומית נדרש כרטיס עם לפחות 32 או 48 ג'יגה בייט זיכרון גרפי, במיוחד אם רוצים לנצל הקשר ארוך. אפשר להעלות אותו עם vLLM מגרסה 0.8.5 או SGLang מגרסה 0.4.6.post1, כשצריך להגדיר מפענח חשיבה כמו deepseek-r1.

ההרצה המקומית הגיונית אם יש לכם חומרה מתאימה ואתם רוצים פרטיות מלאה או שליטה על השרת. אם אין לכם גישה למעבדים גרפיים ייעודיים עם נפח זיכרון מספק, קריאה ל־API חיצוני תחסוך את עלויות החומרה והתחזוקה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-30B-A3B-Thinking-2507-FP8")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי מלא, שינוי קוד והפצה חופשית של תוצרים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי, כך שניתן לשלב אותו במוצרים פנימיים או מסחריים בלי לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗