GPT
M

MiniMax-M2.7-NVFP4

קוד פתוח

nvidiaother2026-04-13

  • Model Optimizer
  • safetensors
  • minimax_m2
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסת קוונטיזציה של מודל מומחים ענק מבית MiniMax שמכוונת לפיתוח תוכנה וסוכנים חכמים. היא מכווצת בפורמט NVFP4 של אנבידיה כדי לאפשר ריצה מהירה יותר על הדור החדש של המעבדים הגרפיים.

  • 116Bפרמטרים
  • 196,608טוקנים בהקשר
  • 130 GBמשקל הקבצים
  • 16,686הורדות בחודש

מה זה

מדובר בארכיטקטורת תערובת מומחים עם 256 מומחים בסך הכל, כשבפועל מופעלים רק שמונה מומחים שהם 10 מיליארד פרמטרים פעילים בכל טוקן. המודל מתמקד בקוד, חיפוש דינמי בכלים, והרצת סוכנים עצמאיים. חלון ההקשר שלו מגיע ל־204,800 טוקנים, מה שמתאים לטעינת ספריות קוד שלמות ומסמכים מורכבים.

אנבידיה כיווצה פה את המשקלים והאקטיבציות מפורמט FP8 לפורמט NVFP4 באמצעות הספרייה שלהם, מה שהוריד את דרישות הזיכרון והדיסק פי 1.65 בערך. מבחני הביצועים מראים שהקוונטיזציה כמעט לא פגעה בדיוק. במבחן AIME 2025 הוא מקבל 0.888 לעומת 0.892 במקור, ב־LiveCodeBench הוא אפילו עלה ל־0.582, ובמבחן AA-LCR להבנת הקשר ארוך הוא מציג 0.728. הירידות המועטות נרשמו במבחנים כמו MMLU Pro ו־SciCode, אבל ההבדלים נשארים סביב אחוז בודד.

מתאים ל

  • סוכן לתיקון באגים

    מאתר תקלות ומשתמש בכלים בצורה עצמאית על פני בסיס קוד רחב, הודות לחלון הקשר של מעל 200 אלף טוקנים.

  • עריכת מסמכים מרובי שלבים

    מתאים לניתוח מסמכי עבודה ארוכים וסינתזה של מידע מפוזר, תחום שבו הוא מציג תוצאות טובות במבחן AA-LCR.

  • עוזר פיתוח בסביבה פנימית

    משמש ככלי עזר למתכנתים בארגון שמחזיק שרתי Blackwell ורוצה סיוע בכתיבת קוד מבלי להוציא מידע החוצה.

איפה זה נופל

החיסרון המרכזי הוא התלות המוחלטת בחומרה החדשה ביותר של אנבידיה. מעבר לכך, בכרטיס המודל מצוין במפורש שנתוני האימון המקוריים לא נחשפו, והגדרות הבסיס של המבחנים אינן גלויות במלואן. במבחן הקוד המדעי SciCode הוא נעצר על 0.487, תוצאה שמראה שהוא עדיין מתקשה בחישובים ומדע מורכבים ביחס למשימות תכנות רגילות. חובה לבדוק אותו מול משימות הקצה שלכם לפני שבונים עליו תהליכים קריטיים.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת עם שמונה כרטיסי H100?

הכרטיס מציין תאימות ארכיטקטונית ל־NVIDIA Blackwell ובדיקה על B200, מאחר שפורמט NVFP4 מיועד ספציפית לדור הזה. על חומרה מדור קודם תיתקלו בחוסר תמיכה ישיר בהאצת החישוב של הפורמט הזה, ולכן הוא לא מיועד ל־H100.

האם מותר להשתמש במודל הזה בשירות SaaS בתשלום?

לא. המודל מוגדר למטרות מחקר ופיתוח בלבד, וכפוף לרישיון לא-מסחרי של MiniMax ולרישיון הערכת התוכנה של אנבידיה. הפצה שלו בתוך שירות מסחרי מפרה את תנאי הרישיון המדווחים.

איך מריצים

בשביל להריץ אותו צריך חומרה ייעודית וכבדה מאוד. המודל נבדק על כרטיס B200 ותומך בארכיטקטורת Blackwell של אנבידיה, כך שאי אפשר פשוט לזרוק אותו על כרטיסי דור קודם ולצפות שיעבוד כמו שצריך. פקודות ההרצה הרשמיות ב־vLLM וב־SGLang דורשות חלוקה בין שמונה מעבדים גרפיים במקביל.

אם אין לכם אשכול של מעבדי Blackwell בענן או בשרת מקומי, אין מה לנסות להריץ את הקבצים האלה. במצב כזה, עדיף בהרבה לפנות ל־API שמארח את המודל המקורי במקום לנסות להרים תשתית עצמאית ב־130 גיגה-בייט של משקלים.

pip install -U huggingface_hub
hf download nvidia/MiniMax-M2.7-NVFP4

הרישיון

הרישיון כאן הוא שילוב בעייתי למי שבונה מוצר. השימוש כפוף לרישיון ההערכה של אנבידיה וכן לרישיון הלא-מסחרי של MiniMax עצמה. המודל מוגדר מפורשות למחקר ופיתוח בלבד, ולכן אי אפשר לשלב אותו במוצר מסחרי שפתוח למשתמשים משלמים ללא הסדרה משפטית נפרדת.

הרישיון המלא בעמוד המודל ↗