GPT
K

Kimi-K2.7-Code-GGUF

קוד פתוח

unslothother2026-06-12

  • transformers
  • gguf
  • kimi_k25
  • feature-extraction
  • compressed-tensors

גרסת GGUF של מודל ענק לפיתוח תוכנה, שמיועדת למשימות תכנות מורכבות וסוכנים אוטונומיים. הוא מאפשר שילוב תמונה וטקסט עם חלון הקשר עצום, בתנאי שיש לכם שרת ייעודי.

  • 262,144טוקנים בהקשר
  • 3.9 TBמשקל הקבצים
  • 379,032הורדות בחודש
  • 192לייקים

מה זה

מדובר במודל בתצורת תערובת מומחים עם טריליון פרמטרים בסך הכול, שמפעיל 32 מיליארד פרמטרים בכל צעד חישוב, לצד מודול ראייה של 400 מיליון פרמטרים. הוא תוכנן לעבודה כסוכן תוכנה עצמאי, ומחזיק חלון הקשר של 256 אלף טוקנים כדי לקרוא מאגרי קוד שלמים, לנתח תקלות מערכת ולבצע פעולות מרובות שלבים דרך פרוטוקול כלים.

במדדי ביצועים הוא מראה שיפור מול הדור הקודם שלו, עם תוצאה של 62.0 במבחן Kimi Code Bench v2 לעומת 50.9, וציון של 81.1 במבחן MCP Mark Verified שבוחן עבודה מול פלטפורמות כמו גיטהאב ומסדי נתונים. עם זאת, הוא מפגר באופן עקבי אחרי מודלים סגורים כמו GPT-5.5 ברוב מדדי הפיתוח הטהורים, למשל ציון של 53.6 לעומת 69.1 במבחן Program Bench לשחזור קוד מקובץ בינארי. היתרון שלו מגיע מחיסכון של כ־30% בשימוש בטוקנים של חשיבה ומהיכולת להריץ אותו עצמאית בקבצי GGUF.

מתאים ל

  • סוכן תיקון תקלות תשתית

    התמחות בהפעלת כלים רב־שלבית וחיבור למסדי נתונים וגיטהאב.

  • ניתוח מאגרי קוד ענקיים

    חלון של 256 אלף טוקנים מאפשר לבלוע פרויקט שלם ברצף.

  • הסבת מערכות מקובץ בינארי

    יכולת מובנית לבניית התנהגות תוכנה מתוך תיעוד ופלט בינארי.

איפה זה נופל

המודל כופה מצב חשיבה שאי אפשר לכבות אותו, כך שאין אפשרות לקבל מענה מיידי, וכל קריאה גוררת השהיה וצריכת משאבים. בנוסף, יכולת ניתוח הווידאו מוגדרת כניסיונית ונתמכת רק דרך הממשק הרשמי ולא בהרצה עצמאית, וביצועי התכנות הבסיסיים שלו עדיין נמוכים באופן מורגש בהשוואה למודלים המובילים בשוק.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס גרפי בודד?

לא. גרסת Q8 דורשת כמעט 600 גיגה־בייט של זיכרון, וסך הקבצים שוקל מעל 3 טרה־בייט. תצטרכו שרת עם מספר כרטיסים מקצועיים כדי להעלות אותו לאוויר.

האם אפשר לבטל את מנגנון החשיבה כדי לקבל תשובות מהירות?

לא, המודל מחייב שמירה של שרשרת החשיבה בכל אינטראקציה. אין לו מצב עבודה מהיר, והוא תמיד מייצר טוקנים של חשיבה לפני שהוא מגיב.

איך מריצים

ההרצה המקומית של החבילה הזו כבדה מאוד. המשקל הכולל של כלל הקבצים מגיע ל־3.9 טרה־בייט, וכדי להריץ גרסה מכוילת בדיוק Q8 צריך 595 גיגה־בייט של זיכרון, שזה רק עשרה גיגה מעל גרסת Q4. חומרה ביתית או תחנת עבודה בודדת לא יספיקו כאן, ותצטרכו שרת ייעודי עם מספר מאיצים מתקדמים כדי לטעון אותו במנועים כמו transformers, vLLM או SGLang.

אם אתם לא מחזיקים אשכול שרתים מקומי ורוצים רק לבחון אותו על פרויקט, חבל להשקיע ברוחב הפס ובתשתיות. עדיף לקרוא לו ישירות דרך ה־API הרשמי שלו במקום לנסות להרים אותו לבד בעלויות ענן כבדות.

ollama run hf.co/unsloth/Kimi-K2.7-Code-GGUF:Q2_K_XL

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

111 קבצים במאגר, 3.9 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Modified MIT, שמופיע בהגדרות המאגר כרישיון מותאם אישית. לפני שילוב שלו במוצר מסחרי, חובה לקרוא את קובץ התנאים המלא של Moonshot AI כדי לוודא שאין בו הגבלות על שימוש מסחרי, הפצה או פיתוח מודלים מתחרים.

הרישיון המלא בעמוד המודל ↗