GPT
Q

Qwen3-Coder-Next-GGUF

קוד פתוח

unslothapache-2.02026-02-03

  • gguf
  • qwen3_next
  • unsloth
  • qwen
  • qwen3

מודל קוד פתוח לתכנות ולסוכנים, שמחזיק 80 מיליארד פרמטרים אך מפעיל רק 3 מיליארד בכל שלב. הוא נותן חלון הקשר ענק של 256k ומיועד להרצה מקומית יעילה בלי לזלול משאבי חישוב של מודל ענק מלא.

  • 1.6 TBמשקל הקבצים
  • 193,952הורדות בחודש
  • 825לייקים

מה זה

מדובר בארכיטקטורת תערובת מומחים שכוללת 512 מומחים בסך הכול, אך מנתבת כל טוקן לעשרה מומחים פעילים בלבד לצד מומחה משותף אחד. השילוב הזה שומר על מהירות חישוב גבוהה שמזכירה מודלים קטנים בהרבה, יחד עם קיבולת ידע של מודל רחב. המודל מיועד מראש לעבודה מול כלי פיתוח, ממשקי שורת פקודה כמו קלוד קוד, וסביבות עבודה מודרניות.

הוא מאומן ישירות על שימוש בכלים, התאוששות משגיאות ריצה והבנת הקשרים ארוכים במיוחד של עד 262,144 טוקנים. במקום לנסות לפתור הכול בבת אחת, הדגש כאן הוא על סוכני פיתוח שמריצים פקודות, מקבלים פידבק ומתקנים את עצמם לאורך זמן עבודה רציף.

מתאים ל

  • סוכן תיקון קוד בסביבת פיתוח

    מתאים לעבודה בתוך כלי שורת פקודה כמו קלוד קוד, בזכות יכולת מובנית לקרוא לכלים ולהתאושש מטעויות ריצה.

  • ניתוח בסיסי קוד גדולים

    תמיכה מובנית ב־256k טוקנים מאפשרת לטעון קבצים מרובים ומסמכי ארכיטקטורה ישירות להקשר בלי לחתוך אותם.

  • שרת שירותי קוד מקומי בארגון

    הפעלת נקודת קצה פרטית לחלוטין בארגון שדורש אבטחת מידע, עם עלות חישוב נמוכה יחסית בזכות 3 מיליארד מופעלים.

איפה זה נופל

המודל הזה לא כולל מצב חשיבה מובנה ולא פולט בלוקים של תהליך מחשבה, כך שאי אפשר לבקש ממנו לנמק שלב אחרי שלב בשיטה הזו. בנוסף, גרסאות ההרצה הראשונות סבלו מבאג בלאמה סי פי פי שגרם לו להיכנס ללולאות אינסופיות ולפלוט זבל, וכן מתקלות בפענוח קריאות לפונקציות. חייבים לוודא שאתם מריצים גרסאות מעודכנות של כלי ההרצה, ושיש לכם מספיק זיכרון לחלון ההקשר בלי לחטוף קריסות פתאומיות באמצע משימה.

שאלות
נפוצות

איזה כרטיס מסך או חומרה צריך כדי להריץ אותו אצלי?

עבור גרסאות מכווצות בסיסיות תצטרכו לפחות 30 עד 45 גיגה של זיכרון פנוי, בין אם זה זיכרון וידאו ייעודי ובין אם זיכרון מערכת מאוחד במחשבי אפל סיליקון. בשרתים מומלץ להשתמש לפחות בשני כרטיסי מסך מודרניים כדי להחזיק את המודל ולשרת משתמשים בצורה יציבה.

למה המודל נתקע לי בלולאות או מחזיר פלט משובש?

הגרסאות המוקדמות סבלו מבאג ידוע במנוע הריצה שגרם ללולאות פלט ולבעיות בזיהוי כלים. ודאו שעדכנתם את חבילת לאמה סי פי פי לגרסה האחרונה, ושאתם משתמשים בקובצי המודל שעודכנו לאחר התיקון.

איך להימנע מקריסות זיכרון בזמן עבודה עם קבצים גדולים?

ברירת המחדל מנסה לנצל חלון הקשר עצום של 256k טוקנים שזולל נפח זיכרון אדיר. אם ההרצה נכשלת או קורסת, מומלץ להגדיר בהפעלת השרת הגבלת הקשר נמוכה יותר, למשל 32,768 טוקנים.

איך מריצים

כדי להריץ גרסאות מכווצות בפורמט 4 ביט, צריך מחשב עם יותר מ־45 גיגה זיכרון מאוחד או שילוב מקביל של זיכרון כרטיס מסך וזיכרון מערכת. לגרסאות 2 ביט תצטרכו לפחות 30 גיגה. אפשר לטעון אותו ישירות דרך כלי הרצה כמו לאמה סי פי פי, אולאמה, או להרים שרת תואם ממשק אופן איי איי בעזרת וי אל אל אם או אס ג'י לאנג עם הגדרת פיצול לשני כרטיסי מסך לפחות.

אם אין לכם תחנת עבודה חזקה או מקבוק עם הרבה זיכרון מאוחד, שמירה על חלון ההקשר המלא של 256k תפיל את השרת על חוסר זיכרון. במקרה כזה כדאי להגביל את ההקשר מראש ל־32,768 טוקנים, או פשוט לצרוך שרת קיים דרך ממשק תוכנה במקום להיאבק בהרצה עצמית.

ollama run hf.co/unsloth/Qwen3-Coder-Next-GGUF:Q5_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

66 קבצים במאגר, 1.6 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון אפאצ'י 2.0 המקובל. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של המשקלים, שילוב במוצרים פרטיים או ציבוריים והפצה מחדש, בלי דרישה לחלוק את קוד המקור של המוצר שלכם. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗