GPT
Q

Qwen3-Coder-30B-A3B-Instruct

קוד פתוח

Qwenapache-2.02025-07-31

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל קוד בארכיטקטורת תערובת מומחים שמפעיל רק 3.3 מיליארד פרמטרים בכל טוקן מתוך 30.5 מיליארד. הוא תוכנן לסוכני פיתוח אוטונומיים עם חלון הקשר עצום של 262,144 טוקנים.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 56.9 GBמשקל הקבצים
  • 720,300הורדות בחודש

מה זה

מדובר במודל MoE שמחזיק 128 מומחים בסך הכול ומפעיל רק 8 מהם בכל רגע נתון. המבנה הזה נותן קיבולת ידע של רשת בת 30.5 מיליארד פרמטרים, אבל זמן החישוב בפועל נמוך בהרבה ודומה למודל קטן של 3.3 מיליארד פרמטרים. השילוב הזה מכוון ישירות לצווארי בקבוק של מפתחים שצריכים תגובה מהירה בלי לוותר על הבנה עמוקה של לוגיקה ותחביר.

ההתמקדות העיקרית שלו היא עבודה מול כלים, הרצת פקודות ואינטגרציות של סוכנים כמו CLINE או סביבות דפדפן. חלון ההקשר מגיע ל־262,144 טוקנים ישירות מהקופסה, עם אפשרות מובנית להרחבה עד מיליון טוקנים בשיטת Yarn. המשמעות היא שאתם יכולים לטעון לתוכו ריפוזיטורי שלם עם עשרות קבצים, והוא ינווט בין הקריאות והפונקציות בלי לאבד את ההקשר.

מתאים ל

  • סוכני פיתוח אוטונומיים

    חיבור ישיר לכלים כמו CLINE שמריצים פקודות ובודקים קוד בזכות תמיכה ייעודית ב־tool calling.

  • ניתוח בסיס קוד שלם

    טעינת עשרות קבצים במקביל לחלון של 256K טוקנים כדי לאתר תלויות ולבצע ריפקטורינג רחב.

  • הפעלת דפדפן וכלי רשת

    שליטה בפעולות דפדפן וממשקים חיצוניים במסגרת משימות אוטומציה מורכבות שמצריכות סוכן עצמאי.

איפה זה נופל

המודל הזה רץ אך ורק במצב non-thinking. הוא לא מייצר בלוקים של מחשבה כמו דגמי הסקת מסקנות ייעודיים, ולכן אי אפשר לראות את שלבי הביניים של התכנון שלו לפני קבלת הקוד. אם הבעיה שלכם דורשת פתרון מתמטי עמוק או חשיבה אלגוריתמית רב־שלבית מורכבת במיוחד, היעדר מנגנון החשיבה המובנה עלול לפגוע באיכות הפלט. בנוסף, חלון ההקשר המלא תובעני מאוד, ואם תנסו לדחוף פרויקט שלם לתוך כרטיס ביתי תקבלו שגיאות זיכרון מיד.

אותה משפחה

Qwen3-Coder יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל חושב ומציג תגיות think לפני שהוא כותב קוד?

לא. המודל תומך רק במצב non-thinking ולכן הוא לא מייצר בלוקים של הסקת מסקנות בפלט. אין צורך להגדיר דגלים מיוחדים לכיבוי החשיבה בקוד, הוא פשוט פולט את התוצאה ישירות.

מה עושים אם מקבלים שגיאת חוסר זיכרון בזמן הריצה?

קודם כול מצמצמים את חלון ההקשר מ־256K לערך נמוך יותר כמו 32,768 טוקנים. פתיחת כל ההקשר דורשת כמות עצומה של VRAM מעבר ל־57 הגיגה בייט של המשקלים עצמם.

איך מריצים

כדי להריץ אותו עצמאית תצטרכו לאחסן 56.9 גיגה בייט של משקלים בזיכרון, מה שמחייב חומרת שרתים כמו כרטיס A100 או שני כרטיסי 24 גיגה בייט לפחות בפורמט bfloat16. אם אתם רוצים לפתוח את כל חלון ההקשר של 256K, זיכרון ה־KV יתנפח משמעותית וידרוש משאבים נוספים. במקרה של מחסור בזיכרון, ההמלצה הישירה היא לחתוך את ההקשר ל־32,768 טוקנים.

ברמת התוכנה חובה לעדכן לספריית transformers מגרסה 4.51.0 ומעלה, אחרת תקבלו שגיאת KeyError על הארכיטקטורה. אפשר להריץ אותו מקומית גם דרך Ollama, llama.cpp, KTransformers או LMStudio. אם אין לכם חומרה ייעודית עם מספיק VRAM להחזקת המשקלים וטבלאות הקשב, קריאה ל־API חיצוני תהיה זולה ופשוטה בהרבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-Coder-30B-A3B-Instruct")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של המשקלים, הפצה ושילוב במוצרים סגורים. אתם רשאים לבנות עליו שירותים או להטמיע אותו בתוך מוצר פנימי לחברה בלי לשלם תמלוגים, בתנאי שאתם שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗