GPT
K

Kimi-K2-Thinking

קוד פתוח

moonshotaiother2025-11-04

  • transformers
  • safetensors
  • kimi_k2
  • text-generation
  • conversational

מודל ענק שמחבר חשיבה ארוכה עם הפעלת כלים רציפה לאורך מאות צעדים. הוא מיועד למי שבונה סוכנים אוטונומיים למשימות מחקר וקוד מורכבות.

  • 1026Bפרמטרים
  • 262,144טוקנים בהקשר
  • 553 GBמשקל הקבצים
  • 46,356הורדות בחודש

מה זה

מדובר במודל מומחים של טריליון פרמטרים שרק 32 מיליארד מהם מופעלים בכל טוקן, עם חלון הקשר של 262,144 טוקנים. הוא אומן לשלב תהליכי מחשבה עמוקים יחד עם קריאות לפונקציות חיצוניות, תוך שמירה על יציבות לאורך 200 עד 300 קריאות רצופות, במקום להתפזר אחרי כמה עשרות צעדים כמו שקורה בדרך כלל.

במבחני ביצועים הוא עוקף מודלים סגורים מובילים במשימות חיפוש מורכבות ומחקר, עם תוצאה של 60.2 ב־BrowseComp לעומת 54.9 של המתחרה הגדול. גם במבחן HLE בשילוב כלים הוא הגיע ל־44.9 נקודות. עם זאת, בכתיבה חופשית הוא משיג 73.8 בלבד, ובתכנות מעשי במבחן SWE-bench הוא עומד על 71.3, שזה נמוך יותר ממה שמוציאים מודלים מקבילים.

מתאים ל

  • סוכני מחקר עצמאיים

    הוא מריץ מאות צעדי גלישה ואיסוף מידע ברצף בלי לאבד את מטרת העבודה המקורית.

  • פתרון בעיות מתמטיקה

    מאפשר תהליכי חשיבה ארוכים במיוחד של עשרות אלפי טוקנים המשולבים בהרצת קוד פייתון.

  • אוטומציה בסביבות פיתוח

    יודע לנתח שגיאות מערכת, לקרוא לפקודות שורת פקודה ולתקן קוד באופן מחזורי.

איפה זה נופל

הנקודה החלשה ביותר היא ניהול ההקשר בזמן עבודה ממושכת. כאשר פלט הכלים ממלא את 262,144 הטוקנים, השיטה שהם מציעים פשוט מסתירה את כל הפלטים הקודמים, מה שעלול למחוק מידע קריטי. בנוסף, הוא דורש תקציב מחשבה עצום של עשרות אלפי טוקנים כדי להגיע לתוצאות המפורסמות, ובמשימות כלליות כמו רפואה וכתיבה יוצרת הוא מציג ציונים בינוניים למדי.

אותה משפחה

Kimi-K2 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ אותו על שרת יחיד עם כרטיס גרפי רגיל?

לא. המודל שוקל מעל חצי טרה בייט בזיכרון גם אחרי דחיסה. תצטרכו שרת ייעודי מרובה כרטיסים מקצועיים רק כדי לטעון אותו.

האם הוא מתאים לשיחה קצרה ותשובות מהירות?

ממש לא. הוא בנוי לחשיבה עמוקה שלוקחת זמן ופולטת אלפי טוקנים נסתרים לפני התשובה. בשביל צ'אט פשוט הוא יהיה איטי ויקר מדי.

איך מריצים

המשקלים יושבים ב־80 קבצים בנפח כולל של 553 גיגה בייט, מכיוון שחלק ה־MoE עבר אופטימיזציה ישירה ל־INT4 במהלך האימון. כדי לטעון דבר כזה באופן עצמאי תצטרכו אשכול שרתים רציני עם כמה כרטיסי H100 או A100 שמריצים ספריות כמו vLLM, SGLang או KTransformers.

אם אין לכם תשתית ענן בעלות של אלפי דולרים בחודש, אין שום היגיון להרים אותו לבד. עדיף בהרבה לפנות ישירות ל־API שהחברה מציעה, שתואם לפרוטוקולים המוכרים ומבצע את החישובים בלי שתצטרכו לנהל את החומרה.

from transformers import pipeline

pipe = pipeline("text-generation", model="moonshotai/Kimi-K2-Thinking")
print(pipe("שלום"))

הקבצים

80 קבצים במאגר, 553 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים פורסמו תחת רישיון MIT עם שינויים, המוגדר ברישום כ־other. לא צורף הנוסח המלא של השינויים, ולכן לא ברור אילו הגבלות נוספו על שימוש מסחרי, הפצה או הטמעה במוצרים. חובה לבדוק את קובץ הרישיון המקורי במאגר לפני שמפתחים עליו שירות חיצוני.

הרישיון המלא בעמוד המודל ↗