GPT
K

Inferact/Kimi-K3-DSpark

קוד פתוח

Inferactother2026-07-25

  • vllm
  • safetensors
  • k3_dspark
  • dspark
  • speculative-decoding

זה מודל טיוטה שמיועד להאיץ את ההרצה של Kimi-K3 על vLLM. מי שמריץ את המודל המקורי יקבל איתו ייצור טוקנים מהיר בהרבה בלי לשנות את התוצאה הסופית.

  • 3.6Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 6.6 GBמשקל הקבצים
  • 25,710הורדות בחודש

מה זה

מדובר במודל ספקולטיבי של 3.6 מיליארד פרמטרים הבנוי מחמש שכבות בלבד. הוא לא מייצר טקסט עצמאי, אלא מנחש מראש שבעה טוקנים בכל צעד ומעביר אותם לאישור של Kimi-K3 הגדול. בגלל שהוא חולק עם מודל המקור את אותו מבנה זיכרון מסוג MLA, שני המודלים משתמשים באותו מטמון בדיוק וחוסכים תקורה כבדה של זיכרון.

המדידות מראות קצב שיא של 464 טוקנים לשנייה במשימות חשיבה עם אצווה של אחד על ארבעה כרטיסי GB300. אורך הקבלה הממוצע עומד על כמעט ארבעה טוקנים מתוך שבעה. במשימות מסודרות כמו מתמטיקה ותכנות בסיסי הוא פוגע בלמעלה מחמישה טוקנים ברצף, בעוד שבכתיבה יצירתית או חידות מתמטיות קשות המספר צונח לאזור השניים וחצי.

מתאים ל

  • האצת עיבוד קוד ב־vLLM

    משיג קבלת טיוטה של מעל 5 טוקנים מתוך 7 במבחני תכנות כמו HumanEval ומקצר זמני תגובה.

  • פתרון בעיות מתמטיות

    מנצל מבנה חשיבה צפוי במבחני GSM8K כדי לייצר רצפי חישוב בקצב של עד 5.6 טוקנים לצעד.

  • מערכות RAG עם הקשר ארוך

    שומר על קבלה של מעל 3 טוקנים גם בקלטים של עשרות אלפי טוקנים ומאיץ שליפה מטקסטים ארוכים.

איפה זה נופל

היעילות של המודל תלויה ישירות ברמת האקראיות של הפלט. במשימות של כתיבה חופשית, ניסוח יצירתי או אתגרי AIME, שיעור קבלת הטוקנים יורד ל־2.64, מה שמצמצם משמעותית את תוספת הביצועים מול המשאבים שהטיוטה צורכת. בנוסף, הוא כבול לחלוטין למנוע vLLM ולגרסת Kimi-K3 הספציפית, כך שאי אפשר להשתמש בו כמודל שיחה רגיל או להצמיד אותו למודלי בסיס אחרים.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה לבד כצ'אטבוט קל משקל?

לא. הארכיטקטורה שלו כוללת חמש שכבות ומיועדת אך ורק להצעת טוקנים במקביל למודל Kimi-K3 מלא. בלי מודל מטרה שיבדוק ויאשר את הפלט שלו, הטקסט שיתקבל יהיה חלקי וחסר היגיון.

איך משפיעה טמפרטורת הדגימה על מהירות העבודה?

בטמפרטורה אפס מקבלים את הניצול הגבוה ביותר עם דגימת greedy, במיוחד במתמטיקה ובקוד. כשמעלים טמפרטורה לערכים כמו 1.0, קצב קבלת הטוקנים יורד בכל המשימות בגלל חוסר אחידות בניחושים, ויש להגדיר שיטת דגימה הסתברותית בהגדרות ההרצה.

איך מריצים

ההפעלה נעשית ישירות מתוך vLLM באמצעות הוספת דגל speculative-config לפקודת הריצה הרגילה של Kimi-K3, תוך הגדרת שיטת dspark ושימוש בתוסף FlashInfer MLA. המשקל של קובצי הטיוטה עצמם תופס 6.6 גיגה בייט בלבד, אבל הוא לא רץ לבד.

חומרת היעד נקבעת לפי דרישות המודל המרכזי Kimi-K3, שמחייב מערך שרתים כבד כמו שרתי GB300 עם חלוקת שכבות רחבה. אם אתם לא מחזיקים כבר תשתית שרתים ייעודית כזו ומריצים עליה את מודל המקור בהיקף גדול, עדיף בהרבה להשתמש בנקודת קצה מנוהלת של ספק ענן חיצוני.

pip install -U huggingface_hub
hf download Inferact/Kimi-K3-DSpark

הקבצים

5 קבצים במאגר, 6.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ללא פירוט של תנאים מסחריים או מגבלות שימוש בכרטיס המודל. במצב כזה אי אפשר לדעת אם מותר לשלב אותו במוצר מסחרי, ומומלץ לבדוק את תנאי השימוש של פרויקט המקור Kimi-K3 וספריית TorchSpec לפני שמעלים אותו לסביבת ייצור.

הרישיון המלא בעמוד המודל ↗