GPT
K

Kimi-K3-DSpark

קוד פתוח

RadixArkרישיון לא דווח2026-07-27

  • transformers
  • safetensors
  • qwen3
  • feature-extraction
  • speculative-decoding

זה מודל טיוטה שמאיץ הרצה של Kimi K3 באמצעות פענוח ספקולטיבי. הוא מיועד למי שמריץ את מודל המקור בהקשרים ארוכים ורוצה לקצר זמני תגובה.

  • 2.2Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 4.2 GBמשקל הקבצים
  • 2,585,804הורדות בחודש

מה זה

המשקל הזה לא מייצר טקסט עצמאית, אלא עובד כרכיב עזר שחוזה קדימה בלוקים של שבעה טוקנים עבור Kimi K3. הארכיטקטורה שלו כוללת 5 שכבות תשומת לב מלאה, ראש לוג'יטים מבוסס מרקוב וראש ודאות פר מיקום, כשהוא נעזר בשכבות ביניים של מודל המטרה כדי לשמור על דיוק בהקשר של עד מיליון טוקנים.

בפועל, מדדי הקבלה מראים כמה טוקנים בממוצע מתקבלים בכל מחזור אימות במקום לייצר טוקן בודד. במשימות קוד כמו HumanEval הממוצע מגיע ל־5.51 וב־GSM8K ל־5.41, מה שמספק האצה מורגשת בקוד וחשבון פשוט. לעומת זאת, במתמטיקה מורכבת של AIME26 הקצב יורד לכ־2.98 טוקנים לפעימה, כך שהתועלת שלו פוחתת כשהחשיבה הופכת סבוכה.

מתאים ל

  • האצת עיבוד מסמכי ענק

    שומר על ממוצע קבלה של מעל 4.2 טוקנים בבדיקות RULER עם חלון של מיליון טוקנים.

  • מחוללי קוד בייצור

    משיג מדד קבלה של 5.51 ב־HumanEval ומקצר משמעותית זמני תגובה ביצירת פונקציות.

  • פתרון בעיות חשבון פשוטות

    מגיע לממוצע של 5.41 טוקנים במבחן GSM8K וחוסך קריאות יקרות למודל הראשי.

איפה זה נופל

המודל חסר שכבות embedding ו־unembedding עצמאיות ותלוי לחלוטין בנוכחות Kimi K3 באותו מנוע הרצה. הביצועים שלו תנודתיים במיוחד באורכי פלט בינוניים, כאשר בבדיקות AIME26 בטווח של 1,000 עד 4,000 טוקני פלט שיעור הקבלה צונח לאזור 2.56, מה שמקזז חלק ניכר מהחיסכון בחישוב. נוסף על כך, נדרש שרת SGLang פעיל עם הגדרות ספציפיות כדי לנצל אותו.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה לבד בתור מודל שפה רגיל?

לא, הוא חסר משקלי קלט ופלט בסיסיים ואינו מסוגל לעבד פרומפטים בעצמו. הוא בנוי לעבוד אך ורק כטיוטה ספקולטיבית מול מנוע SGLang שמריץ במקביל את Kimi K3.

כמה זיכרון דרוש כדי להוסיף אותו לשרת קיים?

המשקלים תופסים 4.2 גיגה־בייט בזיכרון בפורמט BF16 על פני 5 שכבות. זו תוספת שולית יחסית לדרישות הזיכרון העצומות של מודל המטרה וההקשר של מיליון טוקנים.

איך מריצים

כדי להריץ אותו משתמשים ב־SGLang ומגדירים אותו תחת הפרמטר speculative-draft-model-path לצד מודל הבסיס. הקבצים שוקלים 4.2 גיגה־בייט בפורמט BF16, אבל מודל המטרה עצמו דורש מערך כבד של שמונה מאיצי GPU במקביל, כפי שמופיע בהגדרות ההרצה עם tp-size 8 וחלון הקשר של עד 1,048,576 טוקנים.

אם אין לכם קלאסטר כזה עם כרטיסים מהשורה הראשונה כמו GB300, אין טעם להוריד את המשקלים למכונה מקומית. במצב כזה עדיף לצרוך את השירות ישירות דרך ספק API שמחזיק את התשתית המתאימה.

from transformers import pipeline

pipe = pipeline("text-generation", model="RadixArk/Kimi-K3-DSpark")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 4.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא ציינו רישיון שימוש במאגר. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות ואין הרשאה מפורשת להשתמש, להפיץ או להטמיע את המשקלים במוצר מסחרי. לפני שמשלבים אותו בסביבת ייצור, חייבים לפנות ל־RadixArk או לבדוק הבהרות לגבי תנאי ההפצה.

הרישיון המלא בעמוד המודל ↗