GPT
K

Kimi-K3-0.40B

קוד פתוח

inference-optimizationmit2026-07-28

  • transformers
  • safetensors
  • kimi_k3
  • feature-extraction
  • custom_code

גרסה מוקטנת של Kimi-K3 שמיועדת לבדיקות ולפיתוח סביב ארכיטקטורת המודל המקורית. היא שימושית למי שבונה כלים סביב המבנה הייחודי של מונשוט ולא רוצה להרים משקלים כבדים.

  • 396Mפרמטרים
  • 4,096טוקנים בהקשר
  • 14.6 GBמשקל הקבצים
  • 56,277הורדות בחודש

מה זה

מדובר במודל זעיר עם כ־396 מיליון פרמטרים בלבד, שנוצר באמצעות כלי של llm-compressor לצורכי פיתוח ובדיקות. במקום 93 שכבות וגודל עצום כמו במקור, צמצמו אותו לשמונה שכבות, הורידו את כמות המומחים מ־896 לשמונה בלבד, והשאירו רק כשני מומחים פעילים לכל טוקן, כך שבפועל מופעלים כ־0.06 מיליארד פרמטרים בכל רגע.

הייחוד כאן הוא שמירת הארכיטקטורה המקורית של Kimi-K3 ביחס מוקטן, כולל שילוב של KDA ו־MLA ביחס של שלוש לאחת, חיבורי שארית, ומבנה ה־MoE בשכבות אחת עד שבע. המודל אותחל מאפס ואומן על דאטה־סט קטן של קופיפסטות עד שהגיע לפרפלקסיטי נמוך משלוש, כך שאין כאן יכולות שיחה או ידע כללי, אלא מימוש קונקרטי שמוכיח שהארכיטקטורה עובדת ומייצרת טקסט רציף.

מתאים ל

  • בדיקת תאימות תשתיות

    וידוא שצינור ההרצה שלכם תומך במבנה השכבות של Kimi-K3 בלי להוריד את המודל המלא.

  • ניפוי שגיאות בקוד דחיסה

    פיתוח ובדיקת אינטגרציה עם ספריית llm-compressor על ארכיטקטורה מורכבת שכוללת KDA ו־MLA.

  • אימון בדיקה מהיר

    הרצת סקריפטים של fine-tuning מקומי כדי לבדוק שהקוד רץ עד הסוף על מודל זעיר.

איפה זה נופל

זה לא מודל שפה לשימוש כללי ואין לו שום היגיון, ידע, או הבנת עברית. המשקלים אותחלו בהתפלגות נורמלית ואומנו רק על טקסטים קצרים של ממים כדי לבדוק שהשכבות מגיבות. למרות שיש לו רכיב עיבוד תמונה בארכיטקטורה, הכרטיס מציין במפורש שהוא מוקטן ולא אומן כלל למשימות ראייה. מי שינסה להכניס אותו למוצר כשכבת בינה יקבל פליטת שטויות בלבד.

שאלות
נפוצות

האם אפשר להשתמש בו לצ'אטבוט או למענה על שאלות?

לא. המודל אומן רק על כמות מזערית של טקסטים לצורך בדיקת תקינות מתמטית של ה־loss, ואין לו שום יכולת שיחה או היגיון.

למה הקוד הרגיל של Hugging Face מחזיר שגיאה בטעינה?

הוא נשען על קוד מידול ספציפי של llm-compressor שלא נמצא בספרייה הרגילה. חייבים להוסיף את הנתיב לספרייה הזו בקוד לפני שטוענים את המשקלים.

האם המודל תומך בתמונות?

לא בפועל. רכיב הראייה קיים במבנה של המודל אך הוא מנוון ולא עבר אימון, כך שהוא לא יזהה שום דבר שיוזן אליו.

איך מריצים

כדי להריץ אותו צריך לייבא קוד מותאם מתוך llm-compressor, כי המודל לא נטען דרך AutoModelForCausalLM הרגיל של transformers. בנוסף, המחלקה KimiK3ForConditionalGeneration לא יורשת מ־GenerationMixin, אז את פקודת ה־generate מפעילים ישירות על המאפיין הפנימי language_model.

מבחינת משאבים, מודל של פחות מחצי מיליארד פרמטרים יכול לרוץ בקלות על מעבד רגיל או על כרטיס מסך בסיסי מאוד בלי שום מאמץ. מצד שני, קובצי המשקל שפורסמו מגיעים לנפח של 14.6 ג'יגה־בייט ב־38 קבצים, שזה משקל חריג מאוד לפרמטרים האלה. אם המטרה היא להשתמש בתוצרים אינטליגנטיים של Kimi, עדיף בהרבה לפנות ל־API מסודר של מודל מלא ולא להתעסק עם הסקלדרון הזה.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="inference-optimization/Kimi-K3-0.40B")
print(pipe("שלום"))

הרישיון

הפרויקט פורסם ברישיון MIT, שזה הרישיון הכי פתוח שיש. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לפתח עליו כלים פנימיים ולהפיץ אותו הלאה, כל עוד משאירים את הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗