GPT
Q

Qwen3-30B-A3B-Thinking-2507

קוד פתוח

Qwenapache-2.02025-07-29

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

ארכיטקטורת מומחים שמפעילה רק 3.3 מיליארד פרמטרים בכל טוקן מתוך 30.5 מיליארד בסך הכל. שווה לבדוק אותו אם אתם מחפשים ביצועי הסקה עמוקים בלי לשלם עלויות ריצה של מודל ענק.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 56.9 GBמשקל הקבצים
  • 74,395הורדות בחודש

מה זה

מדובר במודל שפה מבוסס תערובת מומחים עם 128 מומחים בסך הכל, שמתוכם 8 פעילים בו זמנית. הוא מגיע עם חלון הקשר טבעי של 262,144 טוקנים, ותומך בהרחבה עד למיליון טוקנים באמצעות מנגנוני תשומת לב ייעודיים. המודל עובד במצב חשיבה מובנה בלבד, מה שאומר שהוא מקדיש תהליך חשיבה ארוך לפני הפלט הסופי בלי צורך בהגדרה מיוחדת בקריאה.

במבחני ביצועים הוא עוקף את הדור הקודם שלו בבירור, ומציג תוצאות חזקות במיוחד במתמטיקה וקוד. במבחן AIME25 הוא מגיע לציון של 85.0 לעומת 70.9 בגרסה הקודמת, ובמבחן LiveCodeBench v6 הוא עומד על 66.0 נקודות לעומת 57.4. המשמעות בשטח היא יכולת לפתור בעיות אלגוריתמיות מורכבות יותר בדיוק גבוה יותר, תוך שמירה על דרישות חישוב פעילות נמוכות יחסית.

מתאים ל

  • פתרון בעיות קוד מורכבות

    ניתוח אלגוריתמים ובניית פתרונות תכנות הודות לתוצאה של 66.0 ב־LiveCodeBench v6 ותהליך חשיבה ארוך.

  • ניתוח מסמכים ארוכים

    קריאה של תיעוד טכני נרחב או קובצי ענק בזכות חלון הקשר טבעי של 256K ויכולת הרחבה עד מיליון טוקנים.

  • הפעלת סוכנים וקריאת כלים

    ביצוע משימות רב שלביות שמצריכות כלים חיצוניים, תחום שבו המודל מגיע לציון 72.4 במבחן BFCL-v3.

איפה זה נופל

החיסרון הבולט ביותר הוא חוסר הגמישות בזמן תגובה. המודל פועל במצב חשיבה בלבד, מה שאומר שהוא תמיד חושב לפני שהוא עונה ולא מאפשר כיבוי של המנגנון למשימות קצרות ומהירות. אם אתם צריכים צ׳אט עם תגובה מיידית, ההמתנה תפגע בחוויית המשתמש. בנוסף, הכרטיס מזהיר שהעלאת מדד ה־presence_penalty כדי לצמצם חזרתיות עלולה לגרום לערבוב שפות ולפגיעה קלה בביצועים, נקודה שחייבים לבדוק לעומק אם התוכן שלכם משלב עברית ואנגלית.

אותה משפחה

Qwen3-30B-A3B-Thinking-2507 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר לכבות את מצב החשיבה כדי לקבל תשובה מהירה יותר?

לא. המודל תומך במצב חשיבה בלבד, ותבנית השיחה מוסיפה תגית חשיבה באופן אוטומטי. הוא לא מתאים למשימות פשוטות שדורשות שליפה מיידית ללא תהליך הסקה מוקדם.

איזו חומרה אני צריך כדי לעבוד עם חלון של מיליון טוקנים?

לפי נתוני היצרן תצטרכו כ־240 גיגה בייט של זיכרון GPU. הנפח הזה נדרש כדי להחזיק את משקלי המודל, מפתחות ה־KV להקשר כזה ארוך, וזיכרון העבודה של כרטיסי המסך.

מה צריך לוודא בסביבת הפיתוח לפני הטעינה של המודל?

חובה להתקין ספריית transformers בגרסה 4.51.0 ומעלה. גרסאות ישנות יותר אינן מזהות את הארכיטקטורה ויזרקו שגיאת מפתח על qwen3_moe.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־56.9 גיגה בייט בפורמט bfloat16, כך שתצטרכו כרטיסי מסך עם נפח זיכרון מכובד כדי לטעון אותו. אם תרצו לנצל את ההקשר המורחב של מיליון טוקנים, המפתחים מציינים במפורש שתצטרכו סביב 240 גיגה בייט של זיכרון כרטיסי מסך כדי להחזיק את המשקלים, מטמון ה־KV ופעולות החישוב. מומלץ להריץ אותו דרך vLLM מגרסה 0.8.5 ומעלה או SGLang מגרסה 0.4.6.post1, עם חלוקת עומסים של 4 מעבדים גרפיים במקביל.

אם אין לכם שרת ייעודי כזה בחצר, עדיף להשתמש בנקודת קצה מנוהלת דרך ספק ענן. המודל דורש ספריית transformers בגרסה 4.51.0 ומעלה כדי לזהות את הארכיטקטורה, אחרת תקבלו שגיאת מערכת מיד בטעינה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-30B-A3B-Thinking-2507")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, להפיץ אותו מחדש ולשלב אותו במוצרים פנימיים או חיצוניים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗