GPT
M

MiniMax-M3-MXFP8

קוד פתוח

MiniMaxAIother2026-06-02

  • transformers
  • safetensors
  • minimax_m3_vl
  • image-text-to-text
  • multimodal

מודל מולטימודלי ענק של מיליון טוקנים בפורמט מכווץ, שמפעיל רק 23 מיליארד פרמטרים בכל שלב. הוא מעניין את מי שרוצה לעבד תמונות, וידאו וטקסט ארוך בלי לחשב מאות מיליארדי משקלים בבת אחת.

  • 440Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 413 GBמשקל הקבצים
  • 282,297הורדות בחודש

מה זה

מדובר במודל שמקבל תמונות וטקסט ופולט טקסט, עם ארכיטקטורת תערובת מומחים שכוללת כ־440 מיליארד פרמטרים בסך הכול, אך מפעילה רק כ־23 מיליארד פרמטרים בזמן ריצה. הוא אומן מראש על שילוב של טקסט, תמונה ווידאו יחד, ולא כשכבות שהודבקו על מודל שפה קיים.

הייחוד הטכני כאן הוא מנגנון קשב דליל ייעודי בשם MSA. לפי היצרן, המנגנון הזה מאיץ את שלב הטעינה פי 9 ואת שלב הפליטה פי 15 לעומת הדור הקודם בחלון של מיליון טוקנים, ומוריד את החישוב לכל טוקן לחלק העשרים. בנוסף, יש לו שלושה מצבי חשיבה נפרדים שמאפשרים לכבות, להפעיל תמיד או לתת לו לבחור מתי לנמק לפני תשובה.

מתאים ל

  • ניתוח מאגרי קוד ענקיים

    חלון של מיליון טוקנים ומנגנון חשיבה מובנה מתאימים לסריקת פרויקטים שלמים ומציאת תלויות מורכבות.

  • תחקור מסמכים מרובי תמונות

    אימון מולטימודלי מהיסוד מאפשר לחבר בין דיאגרמות, צילומי מסך והוראות טקסטואליות ארוכות במיוחד.

  • סוכני פעולה אוטונומיים

    שילוב בין ביצועי קוד, תמיכה בתהליכים ממושכים ומצב חשיבה אדפטיבי שמתאים למשימות מתמשכות.

איפה זה נופל

הכרטיס מדבר בעיקר על מהירויות MSA והצלחה במשימות קוד וסוכנים, אך לא מציג פירוט מדויק של נקודות תורפה, הזיות או כשלי שפה. חלון של מיליון טוקנים תמיד סובל מירידה בריכוז בחלקים הפנימיים, ושימוש בקשב דליל עלול לפספס פרטים קטנים כשדוחסים מידע מורכב מקבצי וידאו או מסמכים ענקיים. חובה לבדוק אותו עצמאית מול הנתונים שלכם לפני שסומכים עליו.

שאלות
נפוצות

אפשר להריץ את המודל הזה על תחנת עבודה רגילה עם כרטיס יחיד?

לא. המודל דורש כ־413 גיגה בייט רק כדי להטעין את המשקלים לזיכרון לפני שמתחילים לחשב טוקן אחד. תצטרכו שרת ייעודי עם מערך כרטיסי מסך ארגוניים כדי לעבוד איתו מקומית.

מה ההבדל בין גרסת MXFP8 לגרסה הרגילה?

גרסה זו מכוילת בפורמט נקודה צפה של 8 ביט כדי להקטין את צריכת הזיכרון ולהאיץ את החישוב. היא תופסת פחות מקום מחצי דיוק רגיל, אך דורשת חומרה שתומכת בחישובי FP8 בצורה טבעית כדי להרוויח את המהירות.

איך משפיע מצב החשיבה על זמני התגובה?

כאשר מצב החשיבה פועל, המודל מייצר טוקנים נסתרים של הסבר עצמי לפני התשובה הסופית, מה שמעלה את זמן ההמתנה. לביצועים מהירים אפשר לכבות אותו, או להשתמש במצב האוטומטי שבוחר להעמיק רק בבעיות קשות.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־413 גיגה בייט ב־52 חלקים, בכיול MXFP8. כדי להחזיק מודל כזה בזיכרון ולהריץ אותו בחלונות הקשר גדולים תצטרכו שרת עם מספר כרטיסי GPU חזקים מאוד וזיכרון VRAM מצטבר של מאות גיגה בייט. תמיכה בהרצה מקומית קיימת דרך SGLang, vLLM וספריית transformers הרגילה.

אם אין לכם קלאסטר כזה בחצר או בענן פרטי, אין שום הגיון להרים את התשתית הזו לבד. MiniMax מציעה שירות מנוהל וגישה דרך API, ושם אתם משלמים רק על קריאות במקום לתחזק שרתים כבדים שזוללים חשמל ורוחב פס רק כדי להישאר פועלים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="MiniMaxAI/MiniMax-M3-MXFP8")
print(pipe("שלום"))

הקבצים

52 קבצים במאגר, 413 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ומפנה לקובץ חיצוני במאגר הראשי. הוא לא מוגדר כרישיון קוד פתוח סטנדרטי מסוג MIT או Apache, ולכן אסור להניח שמותר להשתמש בו מסחרית או להטמיע אותו במוצר בלי לקרוא היטב את תנאי השימוש המדויקים של MiniMax בקובץ המקורי.

הרישיון המלא בעמוד המודל ↗