GPT
K

Kimi-K2.6-GGUF

קוד פתוח

unslothother2026-04-20

  • transformers
  • gguf
  • compressed-tensors
  • unsloth
  • kimi_k25

מודל ענק בתצורת מומחים שנבנה לפיתוח תוכנה מורכב, תפעול כלים וסוכנים אוטונומיים. הוא מעניין את מי שמחפש יכולות שמתחרות במודלים המובילים בעולם בסביבה מקומית.

  • 3.3 TBמשקל הקבצים
  • 326,642הורדות בחודש
  • 176לייקים

מה זה

מדובר במודל מולטימודלי של טריליון פרמטרים שמפעיל 32 מיליארד פרמטרים לכל טוקן, עם חלון הקשר של 256 אלף טוקנים ומנגנון ראייה מובנה. המבנה שלו מבוסס על 384 מומחים שמתוכם נבחרים שמונה בכל צעד, לצד שימוש בארכיטקטורת MLA לחסכון בזיכרון בזמן ריצה.

המודל תוכנן מראש למשימות תכנות ארוכות, תפעול מסוף וניהול סוכנים מקביליים שיכולים לחלק עבודה למאות תתי משימות. בבנצ'מרקים של כתיבת קוד כמו SWE-Bench Verified הוא הגיע לציון 80.2, ובמשימות סוכנים כמו DeepSearchQA הוא הציג 83 אחוזי דיוק, תוצאות שמעמידות אותו בשורה אחת מול המודלים המסחריים הגדולים ביותר.

מתאים ל

  • פתרון בעיות קוד מורכבות

    מגיע לתוצאות חזקות במבחני SWE-Bench ומסוגל לבצע שינויים מרובי קבצים בשפות תכנות שונות.

  • סוכני רשת ואוטומציה

    מיועד להרצת תהליכים מרובי צעדים, שימוש בכלי חיפוש וגלישה ופירוק משימות לסוכני משנה.

  • בניית ממשקים מתמונות

    משלב מודל ראייה MoonViT ליצירת קוד ממשק ופריסות מלאות מתוך צילומי מסך וסקיצות.

איפה זה נופל

המודל דורש משאבי מחשוב חריגים שמונעים הרצה על חומרה רגילה. במבחני סוכנים מורכבים כמו APEX-Agents הוא השיג ציון של 27.9 בלבד, ובמשימות ראייה בסיסיות ללא שימוש בכלי פייתון כמו BabyVision הוא עומד על 39.8 אחוז. בנוסף, ניתוח וידאו נתמך כרגע רק דרך ה־API הרשמי ולא בהרצה עצמאית.

שאלות
נפוצות

האם אפשר להריץ את גרסת ה־GGUF על מחשב פיתוח רגיל?

לא. משקל הקבצים עומד על כמעט 600 גיגהבייט גם בגרסת קוונטיזציה נמוכה, ומשקל כלל הקבצים מגיע ל־3.3 טרה-בייט. נדרשת חומרת שרתים כבדה עם נפח זיכרון עצום כדי לטעון אותו.

באיזו סביבה נתמכת הרצת המודל מעבר לממשק של Unsloth?

הכרטיס ממליץ על מנועי ההסקה vLLM, SGLang ו־KTransformers. בנוסף נדרשת ספריית transformers בגרסה 4.57.1 ומעלה אך מתחת לגרסה 5.0.0.

איך מריצים

הגרסה הזו ארוזה בפורמט GGUF של Unsloth, כאשר קובץ ה־Q8 שוקל 595 גיגהבייט וגרסת ה־Q4 שוקלת רק עשרה גיגהבייט פחות. כדי להחזיק משקלים כאלה בזיכרון צריך שרת ייעודי מרובה כרטיסי מסך חזקים, או שימוש במנועים כמו vLLM, SGLang או KTransformers לתשתית מקומית.

אם אין לכם אשכול שרתים ארגוני פנוי, עדיף לפנות ישירות ל־API הרשמי של Moonshot שמספק ממשק תואם OpenAI. הרצה עצמית של מודל בנפח של מאות גיגהבייטים תהיה יקרה ואיטית מאוד לרוב המפתחים.

ollama run hf.co/unsloth/Kimi-K2.6-GGUF:Q2_K_XL

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

87 קבצים במאגר, 3.3 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון בעמוד מוגדר כ־other ללא פירוט של התנאים המדויקים בכרטיס. במצב כזה אי אפשר לדעת אם מותר להשתמש בו במוצר מסחרי, ויש לבדוק את תנאי השימוש המקוריים של Moonshot לפני הפצה.

הרישיון המלא בעמוד המודל ↗