GPT
K

Kimi-K2.6-NVFP4

קוד פתוח

nvidiaother2026-05-11

  • Model Optimizer
  • safetensors
  • kimi_k25
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסת קוונטיזציה של אנבידיה למודל ענק עם טריליון פרמטרים שמופעלים מתוכם רק 32 מיליארד בכל שלב. היא נועדה למי שחייב מודל מולטימודלי כבד עם חלון הקשר ענקי על גבי שרתי בלקוול.

  • 262,144טוקנים בהקשר
  • 554 GBמשקל הקבצים
  • 151,662הורדות בחודש
  • 42לייקים

מה זה

מדובר בהמרה של המודל Kimi-K2.6 מחברת Moonshot AI לפורמט NVFP4 שפותח על ידי אנבידיה. המודל מתבסס על ארכיטקטורת MoE בסגנון DeepSeek V3, שבה יש טריליון פרמטרים בסך הכל, אך רק 32 מיליארד מהם מופעלים בפועל בכל טוקן. המודל מקבל קלט של טקסט, תמונה או וידאו, ומסוגל להוציא טקסט, קוד, פניות לכלים ופלט מובנה. חלון ההקשר עומד על 256 אלף טוקנים.

אנבידיה ביצעה כיול באמצעות נתוני חדשות ושיחות, והקוונטיזציה נגעה רק למשקלים ולאקטיבציות של השכבות הליניאריות בתוך בלוקי ה־MoE. המבחנים מראים שהדיוק כמעט לא נפגע בהשוואה לבסיס בפורמט INT4. במבחני SciCode ו־MMMU Pro נרשמה אפילו עלייה קלה בתוצאות, בעוד ב־GPQA Diamond הייתה ירידה זניחה מחצי אחוז. היכולת להחזיק הקשר ארוך ב־AA-LCR נשמרה היטב סביב 71.8 נקודות.

מתאים ל

  • ניתוח מסמכים ומדיה ארוכים

    חלון הקשר של 256 אלף טוקנים לצד יכולת קליטת תמונה ווידאו מאפשרים לסרוק קבצים ארוכים ומורכבים.

  • סוכני אוטונומיה ושירות

    המודל נבדק בביצוע קריאות לכלים ופתרון בעיות חשבון מורכבות במבחן ייעודי עם דיוק של מעל 98 אחוז.

  • פתרון בעיות מדעיות וקוד

    תוצאות גבוהות במבחני SciCode ו־GPQA Diamond מתאימות למשימות תכנות מתקדם וחישוב מדעי.

איפה זה נופל

המודל אומן על נתונים שנאספו מהרשת ומכילים שפה פוגענית והטיות חברתיות. אנבידיה מזהירה שהוא עלול להעצים את ההטיות הללו, להפיק תשובות פוגעניות גם בלי פרומפט בוטה, להמציא פרטים לא מדויקים או להשמיט מידע קריטי. בנוסף, המודל אינו תומך כלל בארכיטקטורות ישנות יותר של אנבידיה כמו Hopper או Ada Lovelace, ומחייב ספציפית מעבדי Blackwell, מה שמגביל מאוד את יכולת הפריסה.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי H100 או כרטיסים ביתיים?

לא. המודל עבר אופטימיזציה לפורמט NVFP4 ונתמך רשמית אך ורק על גבי מעבדי NVIDIA Blackwell כמו B200. כרטיסים מדורות קודמים אינם תומכים בפורמט זה עבור מודל זה.

איזו פקודה צריך להריץ כדי להפעיל את השרת?

מריצים קונטיינר של vLLM ומפעילים את שרת ה־API של המודל עם חלוקה לארבעה כרטיסים. הפקודה כוללת הגדרת מפענח לפניות כלים ולהסברים לפי פורמט kimi_k2 ואישור קוד מרוחק.

איך מריצים

המודל הזה מיועד אך ורק לארכיטקטורת Blackwell של אנבידיה, ונבדק על חומרת B200. ההרצה נעשית ישירות דרך מנוע vLLM באמצעות שרת ה־OpenAI המובנה שלו, עם הגדרה של tensor-parallel-size ל־4, מה שאומר שצריך לפחות ארבעה מאיצים כאלה כדי להעלות אותו.

עם משקל כולל של 554 ג'יגה בייט הפרוסים על פני 81 קבצים, זו לא חומרה שמחזיקים במשרד או בשרת ענן סטנדרטי. אם אין לכם אשכול ייעודי של מעבדי בלקוול, הניסיון להרים את המודל עצמאית אינו מעשי, ועדיף להשתמש ב־API של ספק שירות חיצוני שמארח את המודל.

pip install -U huggingface_hub
hf download nvidia/Kimi-K2.6-NVFP4

הקבצים

81 קבצים במאגר, 554 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש במודל כפוף לרישיון NVIDIA Open Model License לצד רישיון MIT מותאם של Moonshot AI עבור המודל המקורי. המסמך מגדיר אותו כמיועד לשימוש מסחרי ולא מסחרי ברחבי העולם, אך יש לוודא עמידה בתנאי השימוש של שתי החברות לפני שילובו במוצר.

הרישיון המלא בעמוד המודל ↗