GPT
K

Kimi-K2.5-NVFP4

קוד פתוח

nvidiaother2026-01-30

  • Model Optimizer
  • safetensors
  • kimi_k25
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסת קוונטיזציה של אנבידיה למודל Kimi K2.5 של Moonshot AI, שדוחסת טריליון פרמטרים לפורמט NVFP4. היא מיועדת למי שמחפש ביצועי קצה במתמטיקה וקוד על גבי חומרת Blackwell.

  • 262,144טוקנים בהקשר
  • 550 GBמשקל הקבצים
  • 143,510הורדות בחודש
  • 86לייקים

מה זה

מדובר במודל ענק של טריליון פרמטרים שמבוסס על ארכיטקטורת DeepSeek V3, אותו אנבידיה כיילה ודחסה לפורמט NVFP4 באמצעות כלי ה־Model Optimizer שלה. המודל תומך בקלט של טקסט, תמונה ווידאו, ופולט טקסט בחלון הקשר שמגיע עד 256 אלף טוקנים. הקוונטיזציה התמקדה רק במשקולות ובאקטיבציות של השכבות הליניאריות בתוך בלוקי ה־MoE.

מבחני הביצועים מראים שהמעבר לפורמט הדחוס כמעט לא פגע ביכולות ביחס למקור. הוא משיג 87.3 ב־MMLU Pro, ירידה קלה ל־84.0 ב־LiveCodeBench V6 לעומת 85.0 בבסיס, וציון של 96.3 ב־AIME 2025 לעומת 96.1 במקור. המשמעות היא שמקבלים יכולות חשיבה, תכנות ופתרון בעיות מתמטיות ברמה הגבוהה ביותר בלי לאבד דיוק משמעותי בתהליך הכיווץ.

מתאים ל

  • פתרון בעיות מתמטיות

    משיג תוצאה של 96.3 במבחן AIME 2025 ומתאים למערכות שדורשות חישוב והסקה מורכבת.

  • ניתוח מסמכים ארוכים

    תומך בחלון הקשר של 256 אלף טוקנים שמתאים לקריאת תיעוד רחב וטקסטים מרובי פרטים.

  • יצירה ובדיקת קוד

    מחזיק בציון 84.0 ב־LiveCodeBench V6 ומספק ביצועים גבוהים בפיתוח תוכנה.

איפה זה נופל

המודל אומן על נתונים שנאספו מהרשת ומכילים שפה פוגענית והטיות חברתיות, והוא עלול להגביר אותן או לייצר תוכן לא הולם גם בתגובה לשאלות תמימות לחלוטין. בנוסף, הוא עלול לפלוט עובדות שגויות, להשמיט מידע קריטי, או לחזור על טקסט מיותר. תהליך הכיול התבצע על סט נתונים חדשותי באנגלית בלבד, כך שיש לבדוק היטב את ההתנהגות שלו מול קלטי וידאו מורכבים או שפות אחרות לפני שמסתמכים עליו.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי H100 או כרטיסים ישנים יותר?

הכרטיס מגדיר תמיכה בארכיטקטורת Blackwell בלבד ונבדק על B200. פורמט NVFP4 תוכנן עבור החומרה הזו, ולכן כרטיסים מדורות קודמים אינם מתאימים להרצה המיועדת.

האם הקוונטיזציה פגעה ביכולות של מודל הבסיס?

המדידות מציגות פגיעה זניחה בלבד. ב־AIME 2025 המודל עומד על 96.3 לעומת 96.1 במקור, וב־MMLU Pro הוא קיבל 87.3 לעומת 87.1, עם ירידה קלה בלבד במבחן הקוד.

איך מריצים

כדי להריץ אותו צריך חומרת Blackwell של אנבידיה, כאשר הכרטיס נבדק על שרתי B200. ההרצה נעשית דרך vLLM בלינוקס באמצעות הפקודה הרשמית של שרת ה־API, עם tensor parallel של 4, פרסרים ייעודיים ל־tool call ו־reasoning של kimi_k2, ואישור להרצת קוד מרוחק.

משקל הקבצים עומד על 550 גיגה בייט שמחולקים ל־140 קבצים. אם אין לכם גישה לאשכול שרתים ייעודי מהדור החדש עם ארבעה כרטיסי Blackwell לפחות, אין שום דרך מעשית להרים אותו עצמאית במשרד או בענן פשוט, ועדיף להשתמש ב־API מנוהל.

pip install -U huggingface_hub
hf download nvidia/Kimi-K2.5-NVFP4

הקבצים

140 קבצים במאגר, 550 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש כפוף לרישיון NVIDIA Open Model License יחד עם תנאי Modified MIT License של המודל המקורי, והוא מוגדר כמוכן לשימוש מסחרי ולא מסחרי. עם זאת, יש לעיין בתנאים של אנבידיה ולוודא שהמוצר שאתם בונים עומד במגבלות ההפצה והאחריות שהם דורשים.

הרישיון המלא בעמוד המודל ↗