GPT
K

Kimi-Linear-48B-A3B-Base

קוד פתוח

moonshotaimit2025-10-30

  • transformers
  • safetensors
  • kimi_linear
  • text-generation
  • conversational

ארכיטקטורה היברידית של תשומת לב ליניארית שמפעילה רק 3 מיליארד פרמטרים מתוך 49 בכל טוקן. מקבלים חלון של מיליון טוקנים עם צריכת זיכרון נמוכה משמעותית ממודלים רגילים.

  • 49Bפרמטרים
  • 91.5 GBמשקל הקבצים
  • 2,628הורדות בחודש
  • 82לייקים

מה זה

המודל משלב שכבות של מנגנון קשב ליניארי בשם KDA לצד מנגנון MLA גלובלי ביחס של 3 ל־1, במטרה לעקוף את צוואר הבקבוק המוכר של זיכרון ה־KV בהקשרים ארוכים. הוא אומן על 5.7 טריליון טוקנים ומכיל כ־49 מיליארד פרמטרים בסך הכל, אך בזכות המבנה הפעיל בפועל, החישוב השוטף קל בהרבה ממה שהגודל הכולל רומז.

בבדיקות הביצועים של היוצרים הוא מציג ציון 51.0 ב־MMLU-Pro בטווח קצר, וציון 84.3 בבדיקת RULER בהקשר של 128 אלף טוקנים לצד האצה של כמעט פי ארבעה במהירות. המשמעות המעשית היא מודל שמסוגל לעבד מסמכים כבדים מאוד בלי לחנוק את המאיץ הגרפי, ומייצר פלט מהר יותר עד פי שישה בריצות של מיליון טוקנים.

מתאים ל

  • בסיס לאימון מודל ארגוני

    מתאים לכוונון עדין על מסמכי חברה ארוכים בזכות חלון של מיליון טוקנים ודרישות זיכרון קטנות.

  • מחקר ארכיטקטורות ליניאריות

    נקודת מוצא לבדיקת מנגנוני KDA והתנהגות מודלים היברידיים מול מודלי קשב מלא רגילים.

  • הטמעה בצינור עיבוד נתונים

    עיבוד רצפים עצומים של טקסט במהירות גבוהה כחלק ממערכת שמבצעת השלמת טקסט אוטומטית.

איפה זה נופל

מדובר במודל בסיס בלבד ולא במודל שעבר התאמה לשיחה או להוראות. אם תתנו לו פקודה ישירה הוא פשוט ימשיך את הטקסט ולא יענה כמו צ'אטבוט, מה שמחייב אימון נוסף או כוונון עדין לפני שאפשר להציג אותו למשתמשי קצה.

בנוסף, הריצה דורשת קרנלים ייעודיים של תשומת לב ליניארית שלא תמיד נתמכים בכל סביבת עבודה סטנדרטית, וחובה להפעיל קוד מרוחק כדי לטעון אותו.

אותה משפחה

Kimi-Linear יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לשיחה או צ'אט?

לא בצורתו הנוכחית. זו גרסת Base ללא fine-tuning להוראות, ואם תנסו לנהל איתה שיחה תקבלו המשך טקסט סטטיסטי במקום מענה ישיר. לשיחות יש להשתמש בגרסת ה־Instruct.

אפשר להריץ אותו על כרטיס מסך ביתי בודד?

לא. הקבצים לבדם שוקלים 91.5 גיגה-בייט וחייבים להיטען במלואם לזיכרון הווידאו כדי שהמודל יעבוד. תצטרכו שרת ייעודי עם מספר מאיצים גרפיים וזיכרון VRAM כולל שעולה משמעותית על 100 גיגה-בייט.

מה היתרון במבנה של 3 מיליארד מתוך 49 מיליארד?

היכולת להחזיק ידע רחב של מודל גדול לצד מהירות חישוב של מודל קטן. בזמן יצירת הטקסט המעבד מחשב רק את החלק הפעיל, מה שמקצר זמני תגובה וחוסך משאבים בהקשרים ארוכים.

איך מריצים

כדי להריץ אותו מקומית צריך להתקין את ספריית fla-core מגרסה 0.4.0 ומעלה יחד עם פייתון 3.10 ו־PyTorch 2.6 לפחות. המשקל של הקבצים עומד על 91.5 גיגה-בייט שמחולקים ל־38 קבצים, כך שגם אם רק 3 מיליארד פרמטרים פעילים בכל רגע, כל 49 המיליארד חייבים לשבת בזיכרון. תצטרכו שרת עם מספר כרטיסי מסך חזקים, בדומה לדוגמת הפריסה ב־vLLM שדורשת חלוקה לארבעה מאיצים במקביל.

אם אתם לא מחזיקים תשתית כבדה כזו או שאתם לא צריכים לאמן מודל בסיס על נתונים פנימיים, עדיף להשתמש בגרסת ה־Instruct או לפנות לשירותי ענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="moonshotai/Kimi-Linear-48B-A3B-Base")
print(pipe("שלום"))

הרישיון

רישיון MIT חופשי לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו גרסאות המשך ולהפיץ אותו בתוך מוצרים סגורים, בלי דרישה לחלוק קוד מקור. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗