GPT
K

KAT-Coder-V2.5-Dev

קוד פתוח

Kwaipilotapache-2.02026-07-23

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • code

מודל קוד מבוסס תערובת מומחים שמפעיל רק שלושה מיליארד פרמטרים מתוך שלושים וחמישה בזמן ריצה. הוא מכוון ישירות לסוכני תכנות עצמאיים ומציג שיפור חד ביציבות קריאות הכלים.

  • 35Bפרמטרים
  • 262,144טוקנים בהקשר
  • 64.6 GBמשקל הקבצים
  • 43,121הורדות בחודש

מה זה

הבסיס כאן הוא Qwen3.6-35B-A3B שעבר אימון המשך בשני שלבים, כוונון עדין מונחה על 127 אלף דוגמאות ואחריו למידת חיזוק ממושכת. המטרה היתה לפתור בעיות ספציפיות של התנהגות סוכנים. בגרסאות הבסיס מודלים מהסוג הזה נוטים להציף את ההקשר בעשרות קריאות מקבילות לכלים ולייצר לולאות של טקסט חוזר. תהליך האימון של צוות הפיתוח קיצץ את תוויות הכלים השגויות משיעור של 9.34% לרמה של 0.28%, ומחק לחלוטין מקרים של חזרות בלולאה בודדת.

במבחני ביצועים התוצאות מורגשות בעיקר באוטונומיה מול מאגרי קוד. בבנצ'מרק של SWE-bench Verified הוא עומד על 69.40 נקודות, ובגרסה הרב לשונית שלו על 63 נקודות, פער ניכר על פני מודלי בסיס מקבילים באותו סדר גודל. הוא מגיע עם חלון הקשר עצום של 262 אלף טוקנים שמתאים לסריקת פרויקטים שלמים, אך מתמקד אך ורק בעבודה טקסטואלית ובכתיבת קוד.

מתאים ל

  • סוכן לפתרון באגים במאגרים

    תוצאות גבוהות בבדיקות SWE-bench וחלון הקשר גדול מאפשרים לו לנווט בקבצים רבים ולתקן תקלות.

  • אוטומציה בסביבות טרמינל

    אימון ייעודי ריסן קריאות כלים שגויות והפחית יצירת פקודות מקבילות שמציפות את המערכת.

  • שרת שירות מקומי וחסכוני

    מנגנון המומחים מפעיל רק שלושה מיליארד פרמטרים ומספק זמני תגובה קצרים יחסית לגודלו הכולל.

איפה זה נופל

ההפצה הזו היא טקסט בלבד. למרות שמבנה המשקולות נשען על ארכיטקטורה שתומכת במולטימודל, רכיבי הראייה והתמונות הוסרו לחלוטין ולא ניתנים לשימוש. מבחינת שפות, המודל מאומן על אנגלית וסינית בלבד, כך שלא כדאי לבנות עליו לפרויקטים בעברית או להבנת תיעוד מקומי. נקודה קריטית נוספת נוגעת להרצת סוכנים בסביבות מותאמות, בבדיקות ההשוואה מול מערכות שונות נרשמו כשלים והזיות כשהמודל ניסה לקרוא לכלים שלא קיימים בסביבה שלו, כמו כלי עריכה מרובים, כך שחובה להגדיר בדיוק את ארגז הכלים שהוא מכיר כדי למנוע קריסות.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך בודד של מחשב פיתוח חזק?

לא בגרסה הזו. הקבצים שוקלים כמעט שישים וחמישה גיגה בייט ומחייבים חלוקה בין מספר מעבדים גרפיים, כשהמדריכים הרשמיים דורשים מערך של שמונה מאיצים לצורך ניצול מלא של ההקשר.

למה השרת נכשל בהפעלה ומתלונן על רכיבי ראייה חסרים?

המודל מכיל משקולות שפה בלבד ללא מודול התמונות. כדי להעלות אותו ב־vLLM או SGLang חייבים להוסיף בפקודת ההרצה את הדגל הייעודי שמגביל את הטעינה למודל שפה בלבד.

איך מריצים

משקל המשקולות עומד על 64.6 גיגה בייט, מה שמחייב חומרת שרתים ייעודית כדי להחזיק את המודל בזיכרון. הדוגמאות הרשמיות להרצה בפריימוורקים כמו vLLM או SGLang מוגדרות מראש עבור שמונה מאיצים גרפיים עם חלוקת שכבות מקבילית, במיוחד אם רוצים לנצל את מלוא חלון ההקשר. חובה להעביר את הדגל שמודיע למנוע שמדובר במודל שפה בלבד, אחרת השרת יקרוס בניסיון לטעון רכיבי ראייה שלא קיימים בקבצים.

מכיוון שארכיטקטורת המומחים מפעילה רק שלושה מיליארד פרמטרים בכל שלב, מהירות הפקת הטוקנים גבוהה משמעותית ממודל צפוף בגודל מלא. אם אין לכם אשכול שרתים זמין של מספר כרטיסי עיבוד מתקדמים, החזקה עצמית של המודל תהיה יקרה ולא יעילה, ועדיף להתחבר לשרת דרך נקודת קצה מרוחקת בתאימות OpenAI.

from transformers import pipeline

pipe = pipeline("text-generation", model="Kwaipilot/KAT-Coder-V2.5-Dev")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ ברישיון Apache 2.0 מלא. הרישיון מעניק חופש מוחלט לשימוש מסחרי, שינוי קוד, הפצה מחדש והטמעה במוצרים פנימיים או פומביים, ללא תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים המקורית והצהרת הרישיון בכל עותק או תוצר נגזר שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗