GPT
M

MiniMax-M2.5-NVFP4

קוד פתוח

nvidiaother2026-03-11

  • Model Optimizer
  • safetensors
  • minimax_m2
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת לדיוק של 4 ביט למודל הענק של MiniMax, שמתאימה למי שמחזיק שרתי Blackwell וצריך חלון הקשר ענק בלי לאבד יכולות חשיבה.

  • 116Bפרמטרים
  • 196,608טוקנים בהקשר
  • 130 GBמשקל הקבצים
  • 618,768הורדות בחודש

מה זה

מדובר במודל שפותח במקור על ידי חברת MiniMax ועבר כיול והקטנה על ידי אנבידיה לפורמט NVFP4 בעזרת כלי ה־Model Optimizer שלה. המודל שומר על חלון הקשר עצום של 196,608 טוקנים ומכיל תמיכה מובנית בפירוק תהליכי חשיבה והפעלת כלים חיצוניים.

מבחני הביצועים מראים שהמעבר מ־FP8 ל־NVFP4 כמעט לא פגע ביכולות. המודל שומר על רמה דומה מאוד במבחני חשיבה ומדע כמו GPQA Diamond עם ירידה קלה מ־0.845 ל־0.839, ובמבחני תכנות כמו LiveCodeBench V6 מ־0.583 ל־0.577. בבדיקת IFBench של מעקב אחר הוראות נרשמה דווקא עלייה קלה ל־0.752 לעומת 0.734 בגרסת המקור, כך שהכיווץ לא פירק את יכולת ההבנה הבסיסית שלו.

מתאים ל

  • סוכני AI מבוססי כלים

    כולל תמיכה מובנית בפרסור קריאות לכלים חיצוניים ושומר על ביצועים טובים במעקב אחר הוראות מורכבות.

  • ניתוח מסמכים ארוכים

    מתמודד עם קלטים של עד 196,608 טוקנים תחת ניצול זיכרון מופחת משמעותית בכרטיסי Blackwell.

  • פתרון בעיות מתמטיות

    משיג ציון של 0.853 במבחן AIME 2025 ומשלב מנגנון חשיבה מובנה לניתוח שלבי פתרון.

איפה זה נופל

המודל מוגבל לחומרה מסוימת מאוד, וללא כרטיסי Blackwell לא תהנו מהכיווץ. בנוסף, במבחני תכנות מורכבים כמו SciCode הוא מקבל ציון נמוך של 0.452 בלבד, כך שלא מדובר במפתח אוטומטי מלא. גם יכולת השליפה מהקשר ארוך עומדת על 0.674 במבחן AA-LCR, מה שאומר שבטקסטים ארוכים במיוחד הוא מפספס נתונים. נתוני האימון המקוריים אינם גלויים, והכיול בוצע באנגלית על חדשות ומערכי נתונים של אנבידיה, כך שחובה לבדוק תפקוד בעברית לפני חיבור למוצר.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי מסך ישנים יותר כמו H100?

הכרטיס מפרט תאימות לחומרת Blackwell בלבד. לא תוכלו להריץ את פורמט ה־NVFP4 הזה בצורה יעילה על כרטיסים מדורות קודמים, וההמלצה הרשמית נבדקה על גבי B200.

כמה זיכרון נחסך בפועל לעומת גרסת ה־FP8?

דחיסת המשקלים ל־4 ביט מפחיתה את נפח הקבצים ואת דרישות זיכרון ה־GPU פי 1.65 בערך. היא מקטינה את גודל המשקלים ל־130 גיגה־בייט תוך שמירה על רמת דיוק קרובה למקור.

איך מריצים

כדי להריץ את המודל הזה צריך חומרה ייעודית שתומכת במיקרו־ארכיטקטורת Blackwell של אנבידיה, כמו שרתי B200. ההרצה דורשת שמונה כרטיסים במקביל דרך SGLang או vLLM על גבי לינוקס, והקבצים לבדם שוקלים 130 גיגה־בייט.

אם אין לכם קלאסטר של שרתי Blackwell בארגון, אין טעם להוריד את המשקלים למחשב המקומי כי החומרה הישנה לא תנצל את הפורמט הזה. במצב כזה עדיף לצרוך מודלים בגודל דומה דרך ממשקי API חיצוניים במקום לשלם על תשתית כבדה.

pip install -U huggingface_hub
hf download nvidia/MiniMax-M2.5-NVFP4

הרישיון

השימוש כפוף לשני הסכמים: רישיון המודלים הפתוחים של אנבידיה ורישיון MIT מותאם של MiniMax. הכרטיס מציין שהמודל מאושר לשימוש מסחרי ולא מסחרי, אך כולל תנאים ודרישות לבדיקות בטיחות עצמאיות טרם ההטמעה.

הרישיון המלא בעמוד המודל ↗