GPT
Q

Qwen3-Coder-480B-A35B-Instruct

קוד פתוח

Qwenapache-2.02025-07-22

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

זה מודל קוד ענק מבוסס תערובת מומחים עם חלון הקשר של 256K טוקנים. הוא נבנה עבור סוכני פיתוח עצמאיים, קריאת פרויקטים שלמים והפעלת כלים ישירות בקוד.

  • 480Bפרמטרים
  • 262,144טוקנים בהקשר
  • 894 GBמשקל הקבצים
  • 31,718הורדות בחודש

מה זה

מדובר במודל MoE עם 480 מיליארד פרמטרים בסך הכול, כאשר רק 35 מיליארד מהם מופעלים בכל טוקן דרך שמונה מומחים פעילים מתוך 160. המבנה הזה נותן כוח של מודל ענק במהירות חישוב שמתקרבת למודל בינוני, והמטרה העיקרית שלו היא כתיבת קוד, שימוש בדפדפן וקריאה לכלים חיצוניים.

הוא מגיע עם תמיכה טבעית ב־262,144 טוקנים, מה שמאפשר לטעון לתוכו מאגרי קוד מלאים בלי לקצוץ קבצים. לפי הנתונים של היוצרים, הביצועים שלו במשימות תכנות אוטונומיות מתחרים ב־Claude Sonnet, עם פורמט ייעודי לקריאת פונקציות שמתאים לסביבות כמו CLINE.

מתאים ל

  • סוכן לפיתוח פרויקטים

    חיבור ישיר ל־CLINE שמאפשר למודל לקרוא לקבצים ולכתוב קוד עצמאית דרך כלי מערכת ייעודיים.

  • ניתוח מאגרי קוד שלמים

    טעינת פרויקט שלם לזיכרון בזכות חלון הקשר טבעי של 262,144 טוקנים לצורך מציאת באגים וארכיטקטורה.

  • סוכני אוטומציה לדפדפן

    הפעלת כלים וניווט בדפדפן לצורך בדיקות תוכנה ואוטומציה לפי היכולות שהוגדרו בארכיטקטורה שלו.

איפה זה נופל

המודל מגיע במצב שיחה רגיל בלבד ואינו כולל חשיבה מובנית, כך שהוא לא מייצר בלוקים של תהליך מחשבה לפני התשובה. הדרישה שלו לזיכרון עצומה, וכשמנסים להשתמש בחלון ההקשר המלא של 256K מגיעים מהר מאוד לקריסות זיכרון בלי חומרה ארגונית כבדה. בנוסף, למרות ההשוואה ל־Claude Sonnet, הכרטיס אינו מפרט תוצאות מספריות של מדדים ספציפיים אלא הצהרה כללית.

אותה משפחה

Qwen3-Coder יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב פיתוח חזק?

לא בגרסה הזו. הקבצים שוקלים 894 GB ודורשים שרת עם מאות גיגה בייט של זיכרון וידאו ייעודי. מחשב נייד או תחנת עבודה רגילה לא יצליחו אפילו לטעון את המשקולות לזיכרון.

איך מפעילים את מצב החשיבה במודל?

המודל לא תומך במצב חשיבה ולא מייצר תגיות חשיבה בפלט שלו. אין צורך להגדיר משתנים לביטול חשיבה, הוא מחזיר את קוד המקור או את התשובה באופן ישיר.

מה ההגדרות המומלצות ליצירת קוד יציב?

היוצרים ממליצים להגדיר טמפרטורה של 0.7, ערך top_p של 0.8, top_k של 20 ומקדם ענישה על חזרתיות של 1.05. בנוסף מומלץ להקצות עד 65,536 טוקנים לפלט עבור תשובות ארוכות.

איך מריצים

כדי להריץ אותו מקומית צריך לזכור שהמשקל שלו הוא כמעט 900 גיגה בייט בפורמט bfloat16. זה דורש שרת עם מספר כרטיסי מסך חזקים רק כדי להחזיק את המשקולות בזיכרון, עוד לפני שמנצלים את מלוא חלון ההקשר. חובה להשתמש בגרסת transformers 4.51.0 ומעלה כדי לא להיתקל בשגיאות ארכיטקטורה.

אם אין לכם תשתית שרתים ייעודית, עדיף להשתמש בו דרך ספקי צד שלישי או API. למי שמנסה בכל זאת, כלים כמו Ollama, llama.cpp ו־KTransformers תומכים בו, ואם חוטפים שגיאות זיכרון כדאי להגביל את ההקשר ל־32,768 טוקנים במקום המקסימום.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-Coder-480B-A35B-Instruct")
print(pipe("שלום"))

הקבצים

253 קבצים במאגר, 894 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקולות משוחררים תחת רישיון Apache 2.0. זה אומר שמותר להשתמש במודל לצרכים מסחריים, לשנות אותו ולהטמיע אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד שומרים על הודעת הרישיון המקורית ומציינים שינויים שבוצעו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗