GPT
K

Kimi-Linear-48B-A3B-Instruct

קוד פתוח

moonshotaimit2025-10-30

  • transformers
  • safetensors
  • kimi_linear
  • text-generation
  • conversational

מודל שיחה שמבוסס על שילוב של קשב ליניארי עם שכבות קשב מלא, ומתוכנן לרוץ מהר בהקשרים ארוכים במיוחד. הוא מפעיל רק שלושה מיליארד פרמטרים מתוך כמעט חמישים בפועל.

  • 49Bפרמטרים
  • 91.5 GBמשקל הקבצים
  • 177,401הורדות בחודש
  • 595לייקים

מה זה

הארכיטקטורה כאן חריגה בנוף. במקום להשתמש במנגנון קשב מלא רגיל לכל אורך הדרך, המודל הזה משלב מנגנון בשם Kimi Delta Attention יחד עם שכבות קשב גלובליות ביחס של 3 ל־1. המשמעות היא חיתוך של עד 75 אחוז בדרישות הזיכרון של מטמון ה־KV, מה שמאפשר לו לתמוך בחלון הקשר של עד מיליון תוקנים בלי לקרוס תחת עומס הזיכרון. המודל כולו מכיל כ־49 מיליארד פרמטרים, אבל בזמן ריצה מופעלים רק 3 מיליארד פרמטרים בלבד.

בבדיקות המפרסמים, המודל הגיע לציון 51.0 במבחן MMLU-Pro בהקשר קצר של 4,000 תוקנים, במהירות דומה למודלי קשב רגילים. היתרון האמיתי מופיע בהקשרים ארוכים. במבחן RULER באורך 128 אלף תוקנים הוא קיבל ציון של 84.3 עם מהירות גבוהה כמעט פי ארבעה, ובטקסטים של מיליון תוקנים הוא מציג מהירות פענוח מהירה פי שישה לעומת ארכיטקטורות מבוססות MLA.

מתאים ל

  • עיבוד מסמכים ארוכים

    שליפת מידע וניתוח טקסטים של מאות אלפי תוקנים במהירות פענוח גבוהה ובצריכת זיכרון נמוכה.

  • עוזר שיחה להקשר מתמשך

    ניהול שיחות ארוכות במיוחד שלא דורשות איפוס היסטוריה, תוך שמירה על זמני מענה קצרים.

  • מחקר ארכיטקטורות קשב

    בדיקה והשוואה של יעילות מנגנוני קשב ליניארי מול קשב רגיל בשרתי ייצור.

איפה זה נופל

המודל אומן על 5.7 טריליון תוקנים, אבל כרטיס המודל לא מוסר שום מידע על תמיכה בשפות שאינן אנגלית, ובמיוחד אין שום עדות להתאמה לעברית. בנוסף, מנגנון הקשב הליניארי דורש שימוש בקוד מותאם של קרנל חיצוני (fla-core), מה שאומר שהתמיכה בספריות תשתית סטנדרטיות פחות יציבה וקלה מריצת טרנספורמר רגיל. הציון שלו ב־MMLU-Pro, שעומד על 51.0, מראה שיכולות ההיגיון והידע הכללי שלו מתונות למדי ותואמות מודל קטן של 3 מיליארד פרמטרים פעילים, ולא מודל ענק.

אותה משפחה

Kimi-Linear יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד או כרטיס מסך ביתי בודד?

לא. המודל שוקל מעל 91 גיגה-בייט ודורש תצורת שרת עם ארבעה כרטיסי מסך ייעודיים כדי להיטען ולעבוד.

למה מוגדרים 3 מיליארד פרמטרים מופעלים אם יש לו 49 מיליארד?

הארכיטקטורה מפעילה רק חלק קטן מהרשת בכל צעד חישוב, מה שמאפשר מהירות של מודל קטן יחד עם קיבולת זיכרון רחבה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־91.5 גיגה-בייט, כך שאי אפשר להריץ אותו על כרטיס מסך בודד של משתמש ביתי. לפי הוראות ההרצה ב־vLLM, נדרשת חלוקה בין כרטיסים (tensor-parallel-size 4), מה שאומר בפועל שרת עם לפחות ארבעה כרטיסי מסך ייעודיים ברמה של A100 או H100 כדי להחזיק את כל המשקלים ולנצל את חלון ההקשר המלא.

מבחינת תוכנה, נדרשים פייתון 3.10 ומעלה, PyTorch 2.6 לפחות, והתקנה של ספריית fla-core כדי להפעיל את הקרנל המותאם של מנגנון הקשב הליניארי. בנוסף חובה להגדיר trust_remote_code=True בטעינה. אם אין לכם גישה לשרת כזה, אין טעם לנסות להרים אותו מקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="moonshotai/Kimi-Linear-48B-A3B-Instruct")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון MIT. מדובר ברישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים, הפצה ושילוב במוצרים סגורים, בלי דרישה לפתוח את הקוד שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית והפטור מאחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗