GPT
Q

Qwen3-Coder-480B-A35B-Instruct-GGUF

קוד פתוח

unslothapache-2.02025-07-22

  • transformers
  • gguf
  • unsloth
  • qwen3
  • qwen

גרסת GGUF למודל קוד ענק של 480 מיליארד פרמטרים עם 35 מיליארד פעילים. הוא נותן חלון הקשר של 256K ומיועד לפיתוח עצמאי ואוטונומי של תוכנה.

  • 6.6 TBמשקל הקבצים
  • 3,783הורדות בחודש
  • 179לייקים

מה זה

מדובר במודל שפה מסוג תערובת מומחים, שמחזיק 480 מיליארד פרמטרים בסך הכל אבל מפעיל רק 35 מיליארד בכל שלב חישוב, מתוך שמונה מומחים פעילים מתוך 160. המבנה הזה נותן מהירות ריצה סבירה יחסית למודל בגודל כזה, בלי לסחוב את כל המשקל בחישוב השוטף.

הייעוד העיקרי שלו הוא עבודה כסוכן פיתוח, כולל שימוש בכלים, הרצת דפדפן, והבנת מאגרי קוד שלמים. הוא מגיע עם חלון הקשר טבעי של 262,144 טוקנים, וניתן להרחבה עד מיליון טוקנים עם טכניקת Yarn. בכרטיס המודל מצהירים על תוצאות שמשתוות לקלוד סונט במשימות קידוד בסיסיות ובמשימות סוכן אוטונומי, וקריאות פונקציה מובנות ישירות בפורמט התקשורת שלו.

מתאים ל

  • סריקת מאגרי קוד גדולים

    חלון של 256K טוקנים קורא פרויקטים שלמים כדי לאתר תלויות ולתקן באגים רוחביים.

  • סוכן לפיתוח אוטונומי

    כולל תמיכה מובנית בקריאות פונקציה לפלטפורמות כמו CLINE והפעלת דפדפן.

  • הפקת פונקציות מורכבות

    תומך ביצירת פלט רציף של עד 65,536 טוקנים ברצף ללא קיטוע.

איפה זה נופל

המודל תומך רק במצב ללא חשיבה. הוא לא מייצר בלוקים של תהליך מחשבה מקדים כמו דגמי reasoning מודרניים, ואין אפשרות להפעיל את זה. בנוסף, חלון ההקשר המלא של 256K תובעני מאוד מבחינת זיכרון, והמפתחים מודים שאם נתקלים בנפילות זיכרון מסוג OOM, הפתרון היחיד הוא לחתוך את ההקשר ל־32,768 טוקנים בלבד. מעבר לזה, הכרטיס אינו כולל נתוני מבחנים ספציפיים לגבי תמיכה בשפות שאינן אנגלית או קוד.

אותה משפחה

Qwen3-Coder יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על תחנת עבודה עם כרטיס בודד?

לא. מודל של 480 מיליארד פרמטרים עם קבצים בנפח של טרה בייטים דורש שרת מרובה כרטיסים גרפיים מקצועיים. מחשב שולחני רגיל ייפול מיד מחוסר זיכרון.

האם המודל מציג את תהליך החשיבה שלו לפני מתן תשובה?

לא. המודל פועל אך ורק במצב ללא חשיבה ולא פולט תגיות חשיבה בפלט. אין צורך להגדיר משתנים לביטול החשיבה, זה המצב המובנה היחיד בו.

איך מריצים

המשקל הכולל של הקבצים בריפו מגיע ל־6.6 טרה בייט שמחולקים בין 164 קבצים, כך שאי אפשר להוריד אותו למחשב רגיל. כדי לטעון אותו תצטרכו שרת ייעודי כבד מאוד עם מערך מאיצים רחב ונפח זיכרון עצום, גם בגרסאות מכווצות דרך llama.cpp, Ollama או KTransformers.

בסביבת פייתון חובה להשתמש בגרסת transformers 4.51.0 ומעלה, אחרת תקבלו שגיאת KeyError. אם אין לכם גישה למערך שרתים ארגוני, עדיף לא לנסות להרים אותו מקומית, אלא להשתמש ישירות ב־API חיצוני של ספק ענן או בממשק רשת.

ollama run hf.co/unsloth/Qwen3-Coder-480B-A35B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

164 קבצים במאגר, 6.6 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים המקורית וציון השינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗