GPT
Q

Qwen3-Coder-30B-A3B-Instruct-1M-GGUF

קוד פתוח

unslothapache-2.02025-07-31

  • transformers
  • gguf
  • unsloth
  • qwen3
  • qwen

גרסת MoE לכתיבת קוד שמפעילה רק 3.3 מיליארד פרמטרים בכל טוקן ומגיעה עם חלון של עד מיליון טוקנים. פתרון מהיר למי שרוצה להריץ סוכן מקומי בלי להחזיק שרת יקר.

  • 472 GBמשקל הקבצים
  • 14,600הורדות בחודש
  • 161לייקים

מה זה

מדובר במודל MoE עם 30.5 מיליארד פרמטרים בסך הכול, אבל בפועל רק 8 מתוך 128 מומחים פועלים בכל רגע נתון. המבנה הזה נותן מהירות תגובה של מודל קטן עם מאגר הידע של מודל בינוני, והוא מיועד ספציפית למשימות תכנות, שימוש בסוכנים כמו CLINE והפעלת כלים בדפדפן.

הוא מגיע עם תמיכה טבעית ב־262,144 טוקנים ומסוגל להתרחב עד מיליון טוקנים באמצעות Yarn. זה מאפשר לטעון לתוכו מאגרי קוד שלמים בבת אחת לצורך ניתוח ובניית שינויים רחבים, במקום לחתוך קבצים לחתיכות קטנות.

בניגוד למודלים שמייצרים בלוקים של חשיבה לפני התשובה, המודל הזה פועל ישירות במצב ללא חשיבה. הוא מוציא את הקוד והפונקציות מיד, ללא תגיות מיוחדות, ומחזיר פלט של עד 65,536 טוקנים ברצף.

מתאים ל

  • סוכני תכנות מקומיים

    חיבור ישיר לכלים כמו CLINE או Qwen Code בזכות תמיכה מובנית בקריאות לפונקציות והרצה חסכונית.

  • ניתוח מאגרי קוד

    טעינת פרויקטים שלמים לחלון הקשר מורחב לצורך חיפוש באגים והבנת תלויות רוחביות.

  • אוטומציה ודפדפן

    הפעלת כלי דפדפן וקריאה לכלים חיצוניים בלי להמתין לשלבי חשיבה ארוכים.

איפה זה נופל

המודל לא תומך במצב חשיבה ולא מייצר בלוקים של ניתוח מעמיק, מה שיכול להוביל לטעויות לוגיות עדינות במשימות אלגוריתמיות מורכבות. בנוסף, חלון של מיליון טוקנים דורש חומרה כבדה מאוד, והיצרן עצמו מציין שאם נתקלים בבעיות זיכרון הפתרון המיידי הוא לחתוך את ההקשר ל־32,768 טוקנים, מה שמבטל חלק מהיתרון שלשמו הורדתם אותו.

אותה משפחה

Qwen3-Coder יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד פשוט?

הקובץ המלא דורש מאות גיגה־בייט, אבל גרסאות GGUF מכווצות מאפשרות הרצה על כרטיסי מסך ביתיים או מחשבי מק עם מספיק זיכרון אחוד. אם תנסו להשתמש בחלון הקשר של מיליון טוקנים, המחשב ייחנק מיד מחוסר זיכרון, ולכן תצטרכו להגביל אותו ל־32K.

למה המודל לא מציג תגיות של תהליך חשיבה?

הגרסה הזו אומנה לעבוד ישירות ללא תגיות חשיבה כדי לספק תגובות מהירות ולשמור על תאימות מלאה לקריאות לפונקציות. אם המוצר שלכם מסתמך על קריאת שלבי החשיבה של המודל, הכלי הזה לא יתאים.

איך מריצים

המשקל הכולל של כלל הקבצים במאגר מגיע ל־472 גיגה־בייט, כך שלא מורידים הכול אלא בוחרים קובץ GGUF מכווץ שמתאים לזיכרון שלכם. אפשר להריץ אותו מקומית דרך llama.cpp, Ollama, LMStudio או ישירות בפייתון, בתנאי שגרסת transformers היא 4.51.0 ומעלה כדי לא להיתקל בשגיאות ארכיטקטורה.

אם פותחים את מלוא חלון ההקשר תיתקלו בבעיות זיכרון קשות גם על כרטיסים חזקים. במקרה של חוסר בזיכרון צריך להגביל את ההקשר ל־32,768 טוקנים, ואם אתם חייבים חלון של מיליון טוקנים באופן קבוע, עדיף לפנות ל־API מסחרי במקום להחזיק חומרת שרתים ייעודית בבית.

ollama run hf.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-1M-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

33 קבצים במאגר, 472 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה של המודל או נגזרות שלו בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗