GPT
M

MiniMax-M3-NVFP4

קוד פתוח

nvidiaother2026-06-23

  • safetensors
  • minimax_m3_vl
  • nvidia
  • ModelOpt
  • MiniMax-M3

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת של מודל ענק שמיועדת לניתוח וידאו ארוך, תכנות מורכב והרצת סוכנים. אנבידיה דחסה אותו כדי שייכנס לשרת יחיד בלי לאבד דיוק.

  • 220Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 233 GBמשקל הקבצים
  • 183,033הורדות בחודש

מה זה

מדובר במודל מולטימודלי בארכיטקטורת תערובת מומחים עם 428 מיליארד פרמטרים בסך הכול, שמתוכם רק כ־23 מיליארד פעילים בכל טוקן. הוא קורא טקסט, תמונות וסרטוני וידאו של עד חצי שעה, ומחזיר טקסט דרך חלון הקשר של מיליון טוקנים. אתם יכולים להחליף בו בזמן ריצה בין שני מצבים: מצב חשיבה למשימות לוגיות עמוקות וסוכנים, ומצב רגיל שמוותר על שרשרת המחשבה כדי להחזיר תשובות מהר יותר.

אנבידיה כיווצה כאן את המשקלים והאקטיבציות של המודל המקורי לפורמט NVFP4. מבחני הביצועים מראים שהמחיר בדיוק כמעט אפסי ביחס למקור ב־FP8: ב־GPQA Diamond הוא ירד מ־92.53 ל־91.92, ובמבחן הסוכנים τ²-Telecom הוא שמר על 91.89 לעומת 92.22. היכולת המדעית והתכנותית במבחן SciCode נשארה סביב 49.70 נקודות, כך שהמעבר ל־4 ביט לא פגע ביכולת שלו לבצע משימות כבדות.

מתאים ל

  • סוכני אוטומציה של קוד

    מתאים לביצוע משימות פיתוח ממושכות של מעל שמונה שעות בעזרת תמיכה בכלים מובנים ומצב חשיבה.

  • תחקור קובצי וידאו ארוכים

    מסוגל לסרוק ולנתח הקלטות שלמות באורך של עד 30 דקות יחד עם פרומפטים טקסטואליים.

  • שירות לקוחות רב שלבי

    מציג ציון של מעל 91 נקודות במבחן τ²-Telecom בפתרון בעיות שירות מורכבות שמצריכות שימוש בכלים.

איפה זה נופל

המודל אומן על דאטה גולמי מהרשת שמכיל הטיות ושפה פוגענית. לפי כרטיס המודל, הוא עלול לפלוט טקסט פוגעני, לחזור על עצמו, להשמיט מידע קריטי או לייצר תשובות לא מדויקות גם כשקיבל פרומפט ניטרלי לגמרי. בנוסף, הביצועים שלו ב־SciCode עומדים על פחות מ־50 אחוז, כך שלא הייתי סומך עליו בעיניים עצומות במשימות קוד מדעי מורכבות בלי בדיקה ידנית צמודה.

שאלות
נפוצות

אפשר להריץ אותו על שרת קיים עם כרטיסי H100 או A100?

לא. המודל עבר אופטימיזציה לפורמט NVFP4 ונתמך רק בחומרת NVIDIA Blackwell כמו B200. כרטיסים מדורות קודמים אינם תומכים בארכיטקטורת החישוב הזו.

האם המודל יודע לייצר תמונות או סרטונים בחזרה?

לא, המודל מקבל וידאו, תמונות וטקסט אך פולט מחרוזות טקסט בלבד. הוא מיועד להבנה וניתוח של קלט חזותי ולא ליצירת מדיה חדשה.

איך מריצים

כדי להריץ אותו מקומית חייבים שרת מבוסס NVIDIA Blackwell, למשל שמונה מאיצי B200 במקביל עם חלוקת Tensor Parallelism של 8. המשקל שלו עומד על 233 ג'יגה בייט ב־107 קבצים. ההרצה נעשית דרך מנוע vLLM, אך נכון לעכשיו התמיכה קיימת רק בגרסת ה־Nightly ולא בגרסה יציבה.

אם אין לכם אשכול חומרה מהדור החדש ביותר, אין מה לנסות להוריד את הקבצים האלה. במצב כזה עדיף לפנות ישירות ל־API חיצוני שמריץ את המודל המקורי.

pip install -U huggingface_hub
hf download nvidia/MiniMax-M3-NVFP4

הקבצים

107 קבצים במאגר, 233 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש כפוף לרישיון הקהילתי של חברת MiniMax. אנבידיה מבהירה מפורשות שהגרסה הזו מיועדת לשימוש לא מסחרי בלבד. אם אתם מתכננים לשלב אותו במוצר שמכניס כסף, המודל הזה חסום עבורכם ללא הסדרה מול בעלי הזכויות.

הרישיון המלא בעמוד המודל ↗