GPT
K

Kimi-K2.5

קוד פתוח

moonshotaiother2026-01-01

  • transformers
  • safetensors
  • kimi_k25
  • feature-extraction
  • compressed-tensors

מודל ראייה ושפה ענקי בארכיטקטורת תערובת מומחים, שמיועד להפעלת סוכנים אוטונומיים ועיבוד משימות ויזואליות מורכבות עם זיכרון עבודה ארוך במיוחד.

  • 1027Bפרמטרים
  • 262,144טוקנים בהקשר
  • 554 GBמשקל הקבצים
  • 424,279הורדות בחודש

מה זה

זהו מודל מולטימודלי מלא שנבנה מהיסוד על טריליוני טוקנים של טקסט ותמונה יחד, בניגוד לחיבור מאוחר של רכיב ראייה מעל מודל שפה קיים. המבנה שלו מבוסס על תערובת מומחים שמפעילה רק 32 מיליארד פרמטרים מתוך סך הטריליון עבור כל טוקן, מה שמייעל את החישוב בזמן ריצה, לצד מנגנון קשב MLA ואנMoveקודר ראייה ייעודי בשם MoonViT.

בבנצ'מרקים המודל מציג יכולות גבוהות במיוחד כשמאפשרים לו להשתמש בכלים ובמצב חשיבה. במבחן HLE המורכב הוא מזנק מציון של 30.1 ללא כלים לציון 50.2 עם כלים, ועוקף שם מודלים מסחריים סגורים. היכולת הזו באה לידי ביטוי בעיקר בניתוח מסמכים צפופים, חילוץ מידע מתמונות ווידאו, והרצת סוכנים במקביל שמפרקים בעיה גדולה לתת משימות עצמאיות.

מתאים ל

  • חילוץ מידע ממסמכים וסריקות

    משיג 92.3 בבדיקות OCR ומנתח תרשימים וטבלאות ברמת דיוק גבוהה מתוך קובצי תמונה.

  • בניית קוד מעיצובי ממשק

    מסוגל לקבל צילומי מסך או תרשימי זרימה ויזואליים ולתרגם אותם ישירות לשלד תוכנה פעיל.

  • תחקור וסריקת רשת מרובת סוכנים

    יודע לפצל שאילתת חיפוש מורכבת למספר משימות מקבילות עם ביצועים של 79 נקודות במבחני סריקה.

איפה זה נופל

במשימות של כתיבת קוד נקי ותיקון תקלות תוכנה אמיתיות, כמו בבדיקות SWE-Bench, הוא משיג תוצאות טובות אבל עדיין מפגר מעט אחרי מובילי השוק הסגורים. בנוסף, משימות מורכבות שדורשות תכנון בלי גישה לכלים חיצוניים מציגות נפילה משמעותית בביצועים, למשל במבחני ZeroBench שבהם הציונים נמוכים מאוד ללא עזרים. לפני שמשלבים אותו במוצר חייבים לבדוק שהוא לא נתקע בלולאות של קריאות לכלים חיצוניים.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת עם שני כרטיסי H100?

לא. משקל הקבצים לבדו חוצה את חצי הטרה בייט, ודורש זיכרון וידאו גדול בהרבה ממה ששני כרטיסים מציעים. תצטרכו מערך של שמונה כרטיסים מקצועיים לפחות כדי לטעון אותו ולהשאיר מקום להקשר.

מה המשמעות של הפעלת 32 מיליארד פרמטרים בפועל?

למרות שבזיכרון יושב מודל של טריליון פרמטרים, בכל צעד חישוב המערכת מנתבת את המידע רק לשמונה מומחים ספציפיים. זה חוסך כוח עיבוד ומאפשר מהירות תגובה סבירה יותר ביחס לגודל המלא.

איך מריצים

המשקל הגולמי של הקבצים עומד על 554 גיגה בייט, כך שאי אפשר להריץ אותו על שרת בודד פשוט או חומרה ביתית. תצטרכו קלאסטר ייעודי מרובה כרטיסים גרפיים עם מאות גיגה בייטים של זיכרון וידאו כדי לחלק את השכבות והמומחים בין המעבדים.

אם אין לכם תשתית ענן ארגונית שמיועדת למודלי ענק, עדיף בהחלט לפנות ישירות ל־API הרשמי שהחברה מספקת. הרצה מקומית שווה את ההשקעה והתחזוקה רק אם יש דרישת אבטחה קשיחה שאוסרת על הוצאת מידע ומדיה מחוץ לרשת הארגונית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="moonshotai/Kimi-K2.5")
print(pipe("שלום"))

הקבצים

87 קבצים במאגר, 554 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כמותאם אישית על בסיס MIT שונה, ומסומן בקובץ חיצוני. במצב כזה חובה לקרוא היטב את תנאי השימוש הספציפיים במאגר לפני הטמעה מסחרית, כדי לוודא שאין מגבלות על שימוש מסחרי בהיקף גדול, הפצה מחדש של המשקלים או שימוש בפלטים לאימון מודלים אחרים.

הרישיון המלא בעמוד המודל ↗