GPT
M

MiniMax-M1-40k

קוד פתוח

MiniMaxAIapache-2.02025-06-05

  • transformers
  • safetensors
  • minimax_m1
  • text-generation
  • vllm

מודל חשיבה מבוסס MoE עם 456 מיליארד פרמטרים, שתומך בהקשר עצום ומיועד למשימות תכנות וחשיבה ארוכות עם תקציב חשיבה מוגדר של 40 אלף טוקנים.

  • 456Bפרמטרים
  • 10,240,000טוקנים בהקשר
  • 850 GBמשקל הקבצים
  • 5,108הורדות בחודש

מה זה

מדובר במודל MoE במשקל כבד שמפעיל 45.9 מיליארד פרמטרים מתוך 456 מיליארד עבור כל טוקן, ומשלב מנגנון שנקרא lightning attention. המבנה הזה מאפשר לו לעבד הקשרים ארוכים במיוחד ולחסוך חישוב בזמן יצירת פלט ארוך, כשהחברה מדווחת על צריכה של 25 אחוז מהחישוב בהשוואה ל־DeepSeek R1 באורכים של 100 אלף טוקנים.

גרסת ה־40k מאומנת עם תקציב חשיבה של עד 40,000 טוקנים לפתרון בעיות. במבחני קוד ותוכנה כמו SWE-bench Verified הוא עומד על 55.6 אחוז הצלחה, מעל גרסאות R1 הראשונות, ובבדיקות הקשר ארוך כמו OpenAI-MRCR על מיליון טוקנים הוא מגיע ל־58.6 אחוז.

מתאים ל

  • ניתוח בסיסי קוד ענקיים

    השילוב בין תמיכה בהקשר של מיליון טוקנים לביצועים חזקים ב־SWE-bench מאפשר לו לנתח פרויקטים שלמים.

  • פתרון בעיות מתמטיקה

    עם תוצאה של 96 במבחן MATH-500 ותקציב חשיבה מובנה, הוא מתאים לפירוק אלגוריתמי צעד אחר צעד.

  • סוכני אוטומציה מרובי שלבים

    הוא כולל תמיכה מובנית בקריאות לפונקציות ומציג תוצאות טובות במבחני שימוש בכלים כמו TAU-bench.

איפה זה נופל

הנתון הכי בעייתי בכרטיס הוא הדיוק בעובדות. במבחן SimpleQA המודל מקבל 17.9 אחוז בלבד, שזה ציון נמוך מאוד שמראה נטייה ברורה להזיות בשאלות ידע ישירות, לעומת מודלים מתחרים שחוצים את ה־30 או ה־50 אחוז. בנוסף, במבחן HLE ללא כלים הוא משיג רק 7.2 אחוז, מה שאומר שחשיבה מופשטת קשה ללא סיוע חיצוני עדיין מפילה אותו בקלות.

אותה משפחה

MiniMax-M1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

מה ההבדל בין גרסת ה־40k לגרסת ה־80k?

ההבדל העיקרי הוא תקרת הטוקנים שהוקצתה לתהליך החשיבה וההסקה של המודל בזמן אימון ה־RL. גרסת ה־40k מיועדת למשימות שדורשות פחות שלבי חשיבה פנימיים וחוסכת זמן חישוב, בעוד גרסת ה־80k מקבלת ציונים מעט גבוהים יותר במבחנים מורכבים.

האם אפשר להריץ אותו על תחנת עבודה משרדית?

לא. המודל שוקל 850 גיגה בייט ומחזיק 456 מיליארד פרמטרים, כך שדרוש שרת ייעודי עם מספר כרטיסי מסך תעשייתיים וזיכרון VRAM עצום כדי לטעון אותו.

באילו הגדרות כדאי להשתמש בזמן הרצת המודל?

היוצרים ממליצים להריץ אותו עם ערך טמפרטורה של 1.0 ו־top_p של 0.95 כדי לשמור על גיוון ויכולת הנמקה, לצד פרומפט מערכת מוגדר היטב לפי סוג המשימה.

איך מריצים

כדי להריץ אותו עצמאית תצטרכו שרת עם כמה מעבדי GPU מתקדמים, כי המשקולות לבדן תופסות 850 גיגה בייט ב־433 קבצים, עוד לפני שחישבתם זיכרון להקשר ארוך. החברה ממליצה לפרוס אותו בעזרת vLLM או ישירות דרך ספריית transformers.

אם אין לכם קלאסטר ייעודי של H100 או כרטיסים מקבילים בכמות נדיבה, אין היגיון לנסות להרים אותו מקומית. עדיף לפנות ל־API הרשמי שהם מציעים או לממשק הצ'אט שלהם ברשת, אחרת תשלמו הון על חומרה ותחזוקה עוד לפני שהטוקן הראשון ייפלט.

from transformers import pipeline

pipe = pipeline("text-generation", model="MiniMaxAI/MiniMax-M1-40k")
print(pipe("שלום"))

הקבצים

433 קבצים במאגר, 850 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקולות שוחררו תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המודל והפצה שלו בתוך מוצרים, כל עוד אתם שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗