GPT
Q

Qwen3-Coder-480B-A35B-Instruct-FP8

קוד פתוח

Qwenapache-2.02025-07-22

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

זה מודל קוד ענק מבוסס תערובת מומחים עם חלון הקשר עצום של 256 אלף טוקנים. הוא פונה למי שצריך ביצועים שמגרדים את אלה של קלוד סונט, אבל ברישיון פתוח לחלוטין.

  • 480Bפרמטרים
  • 262,144טוקנים בהקשר
  • 449 GBמשקל הקבצים
  • 586,570הורדות בחודש

מה זה

מדובר במודל קוד מבוסס MoE שמחזיק 480 מיליארד פרמטרים, אבל מפעיל בפועל רק 35 מיליארד בכל שלב. ההפרדה הזו מאפשרת לו לשמור על קיבולת עצומה לצד מהירות סבירה יותר ביחס לגודל. הוא בנוי סביב 160 מומחים, שמתוכם שמונה נבחרים לכל פעולה, עם תמיכה מובנית בחלון הקשר של 262,144 טוקנים שאפשר להרחיב עד מיליון באמצעות מנגנון Yarn.

המטרה העיקרית שלו היא תכנות סוכני, הפעלת דפדפנים וקריאות לפונקציות. המפתחים מכוונים אותו ישירות לסביבות עבודה כמו CLINE וטוענים לתוצאות שמשתוות לקלוד סונט במשימות פיתוח בסיסיות ומתקדמות. הגרסה הזו מכווצת לדיוק של FP8 עם חלוקה לבלוקים של 128, כדי להקל מעט על המשקל בלי לפגוע בהבנת מאגרי קוד שלמים.

מתאים ל

  • ניתוח ריפוזיטורי שלם

    חלון של 256 אלף טוקנים מאפשר לבלוע עשרות קובצי קוד בבת אחת, לזהות תלויות ולפתור באגים ארכיטקטוניים בלי לפצל את המידע.

  • סוכן פיתוח אוטונומי

    הוא מותאם לקריאות לפונקציות ולעבודה ישירה עם סביבות כמו CLINE לביצוע משימות קוד מורכבות ברצף.

  • אוטומציה לדפדפן

    האימון שלו מכוון להפעלת דפדפן וכלים חיצוניים כדי לסרוק מידע, לתקשר עם אתרים ולבצע פעולות רשת לפי פקודה.

איפה זה נופל

הוא לא תומך במצב חשיבה ולא מייצר בלוקים של תהליך מחשבה, כך שאי אפשר לעקוב אחרי הניתוח הפנימי של הבעיה לפני התשובה. בנוסף, מימוש הדיוק של FP8 בספריית transformers עדיין יוצר בעיות בריצה על גבי כמה מאיצים במקביל, מה שמאלץ להפעיל משתני סביבה ספציפיים כמו CUDA_LAUNCH_BLOCKING שעשויים להאט את הביצועים. אם תנסו לדחוף הקשר מלא של 256 אלף טוקנים על חומרה גבולית, המערכת תיפול מיד על חוסר בזיכרון ותחייב אתכם לקצץ את השיחה.

אותה משפחה

Qwen3-Coder יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ אותו על מחשב פיתוח חזק עם כרטיס מסך בודד?

לא. המודל שוקל 449 גיגה בייט בקובצי המשקלים שלו, והוא דורש אשכול שרתים ייעודי עם כמה כרטיסים בעלי זיכרון וידאו גבוה מאוד רק כדי לעלות לאוויר. במחשב מקומי, גם החזק ביותר, הוא פשוט לא ייטען.

למה מופיעה שגיאת KeyError בהפעלה שלו?

הארכיטקטורה של המודל חדשה ודורשת ספריית transformers מגרסה 4.51.0 ומעלה. אם מותקנת גרסה ישנה יותר, הספרייה לא מזהה את מבנה הבלוקים של qwen3_moe וקורסת מיד בעלייה.

מה ההבדל בין 480 מיליארד הפרמטרים ל־35 המיליארד הפעילים?

בארכיטקטורת תערובת מומחים, המודל מחזיק ידע כולל שנשמר ב־480 מיליארד פרמטרים, אבל עבור כל טוקן שנוצר בפועל הוא בוחר רק שמונה מומחים מתוך 160. המשמעות היא שכוח החישוב בזמן ריצה שווה ערך למודל קטן בהרבה, מה שמשפר את מהירות התגובה.

איך מריצים

כדי להרים את המודל הזה אצלכם תצטרכו שרת עם מפלצת של חומרה. המשקל עומד על 449 גיגה בייט, כך שגם בדיוק של FP8 נדרשים כמה כרטיסי מסך חזקים במיוחד רק כדי לטעון אותו לזיכרון לפני שבכלל שלחתם קלט ראשון. הוא נתמך בספריות כמו transformers, vllm וגם sglang, אבל דורש גרסת transformers מודרנית מגרסה 4.51 ומעלה כדי לא להתרסק על הארכיטקטורה.

אם אין לכם אשכול שרתים ייעודי עם תקציב חשמל של משרד שלם, אל תנסו לארח אותו לבד. עדיף לפנות לנקודת קצה מנוהלת של API מאשר לתחזק שמונה כרטיסי עיבוד מתקדמים רק בשביל להריץ בדיקות קוד פנימיות.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-Coder-480B-A35B-Instruct-FP8")
print(pipe("שלום"))

הקבצים

61 קבצים במאגר, 449 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של המשקלים, הפצה ושילוב בתוך מוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והטקסט של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗