GPT
Q

Qwen3-30B-A3B-Base

קוד פתוח

Qwenapache-2.02025-04-28

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

ארכיטקטורת תערובת מומחים שמחזיקה 30.5 מיליארד פרמטרים אך מפעילה רק 3.3 מיליארד בכל פעולה. מיועד למי שרוצה בסיס לאימון עצמאי עם מהירות של מודל קטן וידע של מודל גדול.

  • 31Bפרמטרים
  • 32,768טוקנים בהקשר
  • 56.9 GBמשקל הקבצים
  • 119,301הורדות בחודש

מה זה

מדובר במודל שפה גולמי מסדרת Qwen3 המבוסס על תערובת מומחים. המערך כולל 128 מומחים בסך הכול, אך בכל רגע נתון רק שמונה מהם מופעלים. המבנה הזה מאפשר לו לעבד טקסט בעלות חישובית נמוכה יחסית לגודלו המלא, תוך שימור הידע שנצבר באימון רחב היקף.

הוא אומן בשלושה שלבים על 36 טריליון טוקנים ב־119 שפות, עם דגש על מתמטיקה, תכנות ומדעים, ותומך בהקשר של עד 32,768 טוקנים. השינויים הארכיטקטוניים מול הדור הקודם כוללים נרמול שכבות מסוג qk layernorm ומנגנון לאיזון עומסים בין המומחים, שמטרתם לייצב את הריצה ולמנוע צווארי בקבוק בזמן החישוב.

מתאים ל

  • אימון מודל ייעודי

    בסיס גולמי מאומן היטב שמתאים לכוונון עדין על דאטה פנימי של ארגון בלי צורך לאמן מאפס.

  • הסקה מהירה של מודל רחב

    מפעיל רק 3.3 מיליארד פרמטרים בפועל, מה שמאפשר מהירות תגובה גבוהה ביחס לנפח הידע שלו.

  • עיבוד מסמכים ארוכים

    תמיכה מובנית ב־32,768 טוקנים מתאימה לקריאה וניתוח של קוד או טקסטים טכניים רחבים.

איפה זה נופל

זהו מודל בסיס לחלוטין. הוא לא עבר התאמה לשיחה, לא הוכשר למלא הוראות ולא כולל שכבת בטיחות שמסננת פלטים. אם תשאלו אותו שאלה ישירה, הוא פשוט ינסה להמשיך את הטקסט ולא בהכרח יענה עליה. הוא לא מתאים לשימוש ישיר מול משתמשי קצה בלי שתבצעו קודם כוונון עדין למשימה הספציפית שלכם.

אותה משפחה

Qwen3 יצא ב־32 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להשתמש בו כצ'אטבוט מיד לאחר ההורדה?

לא. זהו מודל בסיס שלא עבר אימון להוראות או לשיחה, והוא ימשיך את הטקסט שתתנו לו במקום לענות לכם. כדי להשתמש בו כעוזר צריך לאמן אותו קודם על שיחות או לחכות לגרסת Instruct מתאימה.

למה מודל של 3.3 מיליארד פרמטרים פעילים דורש כל כך הרבה זיכרון?

למרות שבכל רגע נתון פועלים רק שמונה מומחים, כל 128 המומחים חייבים לשבת בזיכרון של הכרטיס כדי שהמודל יוכל לנתב ביניהם. המשמעות היא שאתם צריכים מספיק זיכרון כדי להחזיק את כל 30.5 מיליארד הפרמטרים, ולא רק את החלק הפעיל.

מה המינימום הנדרש בקוד כדי לטעון אותו?

צריך לוודא שגרסת transformers בסביבה שלכם היא לפחות 4.51.0. בגרסאות ישנות יותר הארכיטקטורה אינה מוכרת והקוד ייכשל מיד בעלייה.

איך מריצים

כדי להריץ אותו מקומית צריך לפחות 60 גיגה-בייט של זיכרון כרטיס מסך כדי לטעון את כל 26 הקבצים בפורמט המקורי, למרות שרק חלק קטן מהפרמטרים מופעל בכל צעד. חובה לעבוד עם גרסת transformers 4.51.0 ומעלה, אחרת הספרייה לא תזהה את הארכיטקטורה ותזרוק שגיאה.

אם אין לכם חומרה ייעודית של לפחות כרטיס מקצועי אחד או שני כרטיסי קצה חזקים, החזקת המודל בזיכרון תהיה כבדה ויקרה מדי. במקרים כאלה עדיף לפנות ל־API חיצוני, במיוחד אם אתם לא מתכננים לבצע עליו אימון המשך משלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-30B-A3B-Base")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לאמן עליהם מודלים חדשים ולהפיץ אותם בתוך מוצרים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗