GPT
M

MiniMax-M3

קוד פתוח

MiniMaxAIother2026-06-02

  • transformers
  • safetensors
  • minimax_m3_vl
  • image-text-to-text
  • multimodal

ענק מולטימודלי עם מיליון טוקנים שרץ עם 23 מיליארד פרמטרים פעילים בלבד. הוא פונה למי שצריך ניתוח עמוק של קוד, תמונות והקשר ארוך במיוחד בלי לשלם על חישוב מלא של 427 מיליארד פרמטרים.

  • 427Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 796 GBמשקל הקבצים
  • 180,357הורדות בחודש

מה זה

מדובר במודל מולטימודלי שאומן מההתחלה על שילוב של טקסט, תמונה ווידאו. המבנה שלו מבוסס תערובת מומחים עם ארכיטקטורה דלילה בשם MiniMax Sparse Attention, מה שמאפשר לו להחזיק חלון של מיליון טוקנים בלי לקרוס תחת עומס הזיכרון.

היתרון המרכזי מול מודלים אחרים בסדר הגודל הזה הוא היעילות בטקסטים ארוכים. המפתחים מדווחים על האצה של פי 9 בשלב הקריאה ופי 15 ביצירת הטקסט בהשוואה לדור הקודם, לצד ירידה משמעותית בעלות החישוב לכל טוקן. המודל כולל גם מנגנון חשיבה מובנה שאפשר להפעיל, לכבות, או לתת לו להחליט לבד מתי לחשוב.

מתאים ל

  • ניתוח מאגרי קוד ענקיים

    חלון של מיליון טוקנים ומנגנון חשיבה מאפשרים לחקור פרויקטים שלמים בבת אחת.

  • עיבוד מסמכים משולבי תמונה

    אימון מולטימודלי מהיסוד מתאים למסמכים טכניים ארוכים עם דיאגרמות וטבלאות.

  • סוכני עבודה מורכבים

    הארכיטקטורה מכוונת למשימות ארוכות טווח שדורשות תכנון והפעלת שיקול דעת.

איפה זה נופל

החיסרון הברור ביותר הוא הדרישה למשאבים. גם כשרק חלק קטן מהפרמטרים מופעל בכל צעד, המשקל הגולמי של המודל מחייב נפח זיכרון עצום רק כדי לטעון אותו.

כרטיס המודל לא מפרסם נתונים מספריים על שיעורי הזיות, הטיות, או תוצאות מפורטות בעברית. לפני שמכניסים אותו למערכת מבצעית, חובה לבדוק בעצמכם איך הוא מתמודד עם שפות שאינן אנגלית או סינית ואיך מנגנון החשיבה האוטומטי משפיע על זמני התגובה.

שאלות
נפוצות

אפשר להריץ את המודל על תחנת עבודה עם כרטיס בודד?

לא. המודל שוקל כמעט 800 גיגה בייט ומיועד למערכי שרתים מרובי מעבדים גרפיים, גם כאשר משתמשים בכלים כמו KTransformers או בכיול לקוונטיזציה.

מה המשמעות של מצב חשיבה אדפטיבי?

המודל מזהה לבד אם השאלה פשוטה ומחזיר תשובה מהירה, או מעמיק בתהליך חשיבה פנימי כשמדובר במשימה מורכבת של קוד או היגיון.

האם כדאי להריץ מקומית או לגשת דרך ה־API?

בגלל עלויות התשתית הכבדות, הרצה עצמית שווה את ההשקעה רק בארגונים עם דרישות פרטיות מחמירות שאוסרות יציאת נתונים החוצה.

איך מריצים

להריץ מפלצת של כמעט 800 גיגה בייט בדיוק מלא זו משימה שמיועדת לאשכולות שרתים עם כרטיסים ייעודיים. אפשר להשתמש במסגרות כמו SGLang, vLLM או KTransformers, ויש גם תמיכה בגרסאות מכווצות ב־MXFP4 או MXFP8 דרך ATOM.

לרוב הצוותים אין את הברזלים הנדרשים להרצה מקומית יציבה עם קאש לחלון מלא. אלא אם החוק או אבטחת המידע מחייבים אתכם לשמור הכל אצלכם בשרת, שימוש ב־API הרשמי של MiniMax חוסך כאב ראש תשתיתי עצום.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="MiniMaxAI/MiniMax-M3")
print(pipe("שלום"))

הקבצים

82 קבצים במאגר, 796 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר בתור רישיון מותאם אישית של MiniMax. הוא דורש קריאה מעמיקה של קובץ התנאים המקורי כדי לוודא אם מותר להשתמש בו במוצר מסחרי, אילו הגבלות הפצה חלות, והאם מותר למכור גישה לפלטים שלו.

הרישיון המלא בעמוד המודל ↗