GPT
K

Kimi-K2-Thinking-GGUF

קוד פתוח

unslothother2025-11-07

  • transformers
  • gguf
  • unsloth
  • endpoints_compatible
  • conversational

מודל הסקת מסקנות עצום המשלב הפעלת כלים רציפה לאורך מאות שלבים. מיועד למי שבונה סוכנים אוטונומיים למשימות מחקר וקוד מורכבות.

  • 15.4 TBמשקל הקבצים
  • 1,849הורדות בחודש
  • 115לייקים

מה זה

מדובר במודל בתצורת תערובת מומחים עם טריליון פרמטרים כוללים, שמתוכם 32 מיליארד מופעלים בכל טוקן. הוא אומן לחבר בין שרשרת חשיבה מעמיקה לבין קריאות חוזרות לפונקציות חיצוניות. המפתחים מדווחים על יכולת להחזיק רצף עבודה יציב של 200 עד 300 קריאות לכלים בלי לאבד את המטרה בדרך, לעומת שבירה אחרי כמה עשרות צעדים במודלים קודמים.

במבחני ביצועים הוא עוקף מודלים מובילים במשימות חיפוש מבוססות סוכן כמו BrowseComp עם ציון של 60.2 לעומת 54.9 ב־GPT-5, וב־SWE-bench Verified מגיע ל־71.3 אחוז בהנדסת תוכנה. המשמעות בשטח היא יכולת לפתור בעיות שמחייבות איטרציות מרובות של כתיבת קוד, הרצה ותיקון שגיאות, בלי לקרוס באמצע התהליך.

מתאים ל

  • סוכן חקר עצמאי

    אידיאלי למשימות גלישה וחיפוש עמוק הדורשות עד 300 שאילתות ואיסוף מידע עוקב.

  • הנדסת תוכנה מורכבת

    מתאים לפתרון באגים במאגרי קוד הודות לציון של 71.3 אחוז ב־SWE-bench Verified.

  • פתרון בעיות מתמטיות

    מיועד להוכחות וחישובים קשים בזכות תוצאה של מעל 99 אחוז במבחן AIME25 עם כלי פייתון.

איפה זה נופל

הנתונים מראים נפילה בביצועים ברגע שמנתקים את הגישה לכלים חיצוניים. במבחן HLE הטקסטואלי ללא כלים המודל משיג 23.9 בלבד, והוא חלש במיוחד במשימות רפואיות עם 58 נקודות ב־HealthBench לעומת 67.2 ב־GPT-5. בנוסף, חלון ההקשר מוגבל ל־256 אלף טוקנים, וכדי לא לחרוג ממנו בריצות ארוכות המפתחים מסתירים פלטים קודמים של כלים, מה שעלול למחוק מידע היסטורי קריטי במהלך המשימה.

אותה משפחה

Kimi-K2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על תחנת עבודה רגילה?

לא. מדובר במודל עם טריליון פרמטרים בנפח של מעל 15 טרה-בייט שדורש שרתי GPU כבדים ומרובי כרטיסים. מחשב פיתוח רגיל לא יצליח אפילו לטעון את המשקלים לזיכרון.

האם צ'אט רגיל מדגים את היכולות המלאות שלו?

לא. המפתחים מציינים שמצב שיחה רגיל באתר שלהם מקצץ את כמות צעדי הכלים כדי לחסוך זמן. כדי לקבל את הביצועים שמופיעים במבחנים חייבים להפעיל אותו עם גישה מלאה לכלים ותקציב טוקנים רחב לחשיבה.

איך מריצים

הריפו הספציפי מכיל קובצי GGUF מרובים בנפח כולל מפלצתי של 15.4 טרה-בייט. גודל כזה של טריליון פרמטרים דורש אשכול שרתים ייעודי ומרובה מאיצים גרפיים עם מאות גיגה-בייט של זיכרון עבודה, גם כאשר מדובר בכיבוץ INT4 מקורי. מנועי ההרצה המומלצים הם vLLM, SGLang או KTransformers, לצד עבודה בטמפרטורה של 1.0.

לרוב הצוותים אין את התשתית הפיזית או התקציב להחזיק מפלצת כזו פעילה על ברזל מקומי. אם המטרה היא לבדוק את התנהגות הסוכן או לשלב אותו בפיצ'ר ראשוני, כדאי להשתמש ב־API של Moonshot שתומך בתאימות לפרוטוקול של אופנאיי ואנתרופיק במקום להתמודד עם עלויות חומרה כבדות.

ollama run hf.co/unsloth/Kimi-K2-Thinking-GGUF:Q5_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

370 קבצים במאגר, 15.4 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הרשמי מוגדר כ־Modified MIT עבור הקוד והמשקלים, ומופיע כ־other בעמוד. זה לא רישיון MIT רגיל וחופשי לגמרי. לפני שמשלבים את המשקלים במוצר מסחרי, חובה לקרוא את קובץ התנאים המלא של Moonshot כדי לוודא שאין הגבלות שימוש, איסור על תחרות או תנאי הפצה שמגבילים את הפעילות העסקית שלכם.

הרישיון המלא בעמוד המודל ↗