GPT
Q

Qwen3-Coder-30B-A3B-Instruct-FP8

קוד פתוח

Qwenapache-2.02025-07-31

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת קוד מכווצת שמשלבת חלון ענק עם ארכיטקטורת מומחים. מקבלים ביצועי תכנות של מודל ענק עם מהירות חישוב שדורשת הפעלה של שלושה מיליארד פרמטרים בלבד.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 29.1 GBמשקל הקבצים
  • 1,046,110הורדות בחודש

מה זה

מדובר במודל מומחים שמחזיק מעל שלושים מיליארד פרמטרים על הנייר, אבל מפעיל בפועל רק 3.3 מיליארד פרמטרים בכל טוקן דרך שמונה מומחים מתוך 128. הוא מגיע מכווץ ישירות לפורמט שמונה ביט, מה שחוסך התעסקות עם המרות ידניות. הדגש העיקרי כאן הוא על תכנות מבוסס סוכנים, עבודה מול דפדפן וקריאות לפונקציות בכלים כמו קליין.

היתרון הגדול נמצא בזיכרון העבודה, שנמתח ל־262,144 טוקנים באופן טבעי. במקום לזרוק חלקי קוד מבודדים, אפשר לטעון לתוכו ריפוזיטורי שלם בלי לחנוק את החישוב, בתנאי שהחומרה שלכם מסוגלת להחזיק את הקאש הנדרש.

מתאים ל

  • סוכן תכנות מקומי

    חיבור ישיר לכלי פיתוח כמו קליין בזכות התאמה ייעודית לקריאות פונקציות ומהירות תגובה גבוהה.

  • ניתוח מאגרי קוד גדולים

    סריקה והבנה של פרויקטים שלמים בפעימה אחת בזכות חלון הקשר טבעי של מעל 250 אלף טוקנים.

  • אוטומציית דפדפן

    ביצוע משימות ניווט ואיסוף מידע מורכבות ברשת בעזרת אופטימיזציה לשימוש בסוכני ווב.

איפה זה נופל

המודל מגיע במצב שיחה רגיל בלבד ואינו תומך בהפעלת מצב חשיבה או בלוקים של מחשבה פנימית, כך שאי אפשר לבקש ממנו להציג את תהליך ההיגיון המלא. בנוסף, למרות שהקונטקסט נתמך עד רבע מיליון טוקנים, ניסיון לפתוח חלון מלא יביא מהר מאוד לקריסת זיכרון, והמפתחים עצמם מציעים לחתוך ל־32 אלף טוקנים אם חוטפים שגיאות חוסר מקום.

אותה משפחה

Qwen3-Coder יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה המודל מוגדר עם 30 מיליארד פרמטרים אבל רץ מהר?

הוא בנוי בארכיטקטורת מומחים. בזמן חישוב של כל מילה נבחרים רק שמונה מומחים ספציפיים מתוך 128, מה שמפעיל רק 3.3 מיליארד פרמטרים בכל רגע נתון.

האם אפשר להשתמש במצב חשיבה עמוק עם המודל הזה?

לא. הכרטיס מציין במפורש שהגרסה הזו עובדת אך ורק בלי תגיות מחשבה, ואין צורך או יכולת להפעיל מצב חשיבה בפקודות היצירה.

מה עושים כשההרצה קורסת על שגיאות זיכרון?

מגבילים את אורך הקונטקסט. שמירה על 262 אלף טוקנים דורשת זיכרון עצום, וההמלצה של המפתחים במקרה של קריסה היא להגביל את הקלט ל־32 אלף טוקנים.

איך מריצים

המשקל הכולל של הקבצים יושב על קצת יותר מ־29 גיגהבייט. כדי להריץ אותו מקומית בביצועים סבירים צריך כרטיס מסך מודרני שתומך בחישובי שמונה ביט, רצוי עם לפחות 32 עד 48 גיגהבייט זיכרון וידאו, בעיקר בגלל גודל הקונטקסט. המודל רץ בספריות כמו טרנספורמרס מגרסה 4.51 ומעלה, או מנועים מהירים יותר כמו וי־אל־אל־אם וסגלנג.

אם אתם מתכננים להריץ אותו במקביל על כמה כרטיסים דרך טרנספורמרס, קחו בחשבון שיש באגים מוכרים במימוש הפיצול של הקוונטיזציה הזו. במקרים כאלה עדיף לפנות לשרת ייעודי שמריץ מנוע הסקה מתאים, או פשוט לצרוך שירות חיצוני אם אין לכם חומרה תואמת בשלוף.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen3-Coder-30B-A3B-Instruct-FP8")
print(pipe("שלום"))

הרישיון

הרישיון הוא אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע בתוך מוצרים סגורים ולהפיץ מחדש, כל עוד שומרים על הודעת זכויות היוצרים המקורית והתנאים הנלווים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗