GPT
Q

Qwen3-Coder-30B-A3B-Instruct-GGUF

קוד פתוח

unslothapache-2.02025-07-31

  • transformers
  • gguf
  • unsloth
  • qwen3
  • qwen

מודל קוד של שלושים מיליארד פרמטרים שמעיר רק חלק קטן מהם בכל טוקן, כך שמקבלים ביצועים חזקים בתכנות בלי לגרור עומס חישובי כבד.

  • 472 GBמשקל הקבצים
  • 12,623,435הורדות בחודש
  • 980לייקים

מה זה

מדובר בגרסת MoE לתכנות שמחזיקה 30.5 מיליארד פרמטרים בסך הכול, אבל מפעילה רק 3.3 מיליארד פרמטרים פעילים בכל מעבר. יש פה 128 מומחים בסך הכול ומתוכם 8 מופעלים בו זמנית, לצד ארכיטקטורת תשומת לב של 32 ראשים לשאילתות וארבעה למפתחות וערכים. המבנה הזה נותן מהירות תגובה שמזכירה מודלים קטנים בהרבה, תוך שמירה על עומק הידע של מודל גדול. תכונה מרכזית נוספת היא חלון הקשר טבעי של 262,144 טוקנים, שניתן להרחבה עד מיליון טוקנים בעזרת Yarn. הדבר מיועד לטעינה של מאגרי קוד שלמים לתוך הפרומפט כדי לנתח פרויקטים רחבים בלי לחתוך קבצים.

הייעוד המרכזי כאן הוא תכנות מונחה סוכנים, שימוש בכלים וגלישה אוטונומית. המודל מגיע עם תמיכה מובנית בהפעלת פונקציות שמתאימה ישירות לכלים כמו CLINE וסביבות פיתוח מודרניות, ומפיק פלט רציף של עד 65,536 טוקנים לפתרון בעיות ארוכות. מי שמחפש חשיבה גלויה לא ימצא אותה כאן, שכן הוא פועל אך ורק במצב ללא בלוקים של חשיבה, ועונה ישירות בלי שלבי ביניים מודפסים.

מתאים ל

  • סוכני פיתוח אוטונומיים

    שילוב בכלים כמו CLINE בזכות תמיכה מובנית בקריאות לפונקציות וביצוע משימות קוד רציפות.

  • ניתוח מאגרי קוד שלמים

    טעינת פרויקטים גדולים לפרומפט יחיד בעזרת חלון הקשר טבעי של 256K שניתן להרחבה עד מיליון.

  • הסקה מהירה מקומית

    קבלת תגובות מהירות בזכות הפעלה של 3.3 מיליארד פרמטרים בלבד בכל טוקן מתוך ה־30.5 מיליארד.

איפה זה נופל

המודל פועל אך ורק בלי תגיות חשיבה, כך שאי אפשר להפעיל בו תהליך הסקת מסקנות גלוי ומובנה לפני הפלט. בנוסף, חלון ההקשר העצום גובה מחיר כבד בזיכרון, ואם החומרה מוגבלת תצטרכו להקריב את עומק ההקשר ולרדת לאזורי 32 אלף טוקנים כדי למנוע קריסות של חוסר זיכרון. מי שמריץ ספריות ישנות יותר של transformers לפני גרסה 4.51.0 יקבל שגיאה מיידית על סוג המודל ולא יוכל לטעון אותו בכלל.

אותה משפחה

Qwen3-Coder יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מציג את תהליך המחשבה שלו לפני כתיבת הקוד?

לא. הוא תומך רק במצב עבודה ישיר ואינו מייצר בלוקים של חשיבה בפלט שלו. אין צורך להגדיר משתנים לביטול החשיבה, הוא פשוט מדלג עליה ומספק את התשובה מיד.

למה מופיעה שגיאה כשאני מנסה לטעון אותו עם transformers?

הארכיטקטורה של המודל דורשת תמיכה ייעודית שנכנסה רק מגרסה 4.51.0. אם אתם עובדים עם גרסה ישנה יותר תיתקלו בשגיאת מפתח על מבנה המומחים שלו, ולכן חובה לשדרג את הספרייה לפני הטעינה.

איך אפשר להימנע מקריסת זיכרון כשההקשר ארוך מדי?

ברירת המחדל מציעה חלון ענק שעלול לחנוק את החומרה. במקרה של שגיאות חוסר זיכרון, ההמלצה הישירה מהתיעוד היא להגביל את חלון ההקשר ל־32,768 טוקנים כדי לפנות מקום בזיכרון.

איך מריצים

המשקל הכולל של הקבצים במאגר מגיע ל־472 גיגה־בייט שמחולקים בין 33 קבצים שונים, ולכן לא מורידים הכול אלא בוחרים קובץ כיול בודד שמתאים למגבלות החומרה שלכם. כדי להריץ אותו מקומית אפשר להשתמש בתוכנות כמו llama.cpp, Ollama, LMStudio או ספריות כמו transformers בגרסה 4.51.0 ומעלה כדי לא להיתקל בשגיאה על ארכיטקטורת המומחים. הרצה מקומית דורשת זיכרון עבודה שמספיק לאחסון כל 30.5 מיליארד הפרמטרים, גם אם רק 3.3 פעילים בכל רגע נתון.

אם מגיעים למצב של חוסר זיכרון, ההמלצה הרשמית היא לקצר את חלון ההקשר לגודל של 32,768 טוקנים במקום רבע המיליון המלא. ההגדרות המומלצות להסקה הן טמפרטורה של 0.7, ערך טופ פי של 0.8, טופ קיי של 20 ועונש חזרתיות של 1.05.

ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

33 קבצים במאגר, 472 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד והפצה חופשית. אפשר לשלב אותו במוצרים פנימיים או מסחריים, בכפוף לשמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗