GPT
M

MiniMax-M1-80k

קוד פתוח

MiniMaxAIapache-2.02025-06-13

  • transformers
  • safetensors
  • minimax_m1
  • text-generation
  • vllm

מודל חשיבה מבוסס MoE עם חלון הקשר עצום של מיליון טוקנים ותקציב חשיבה של 80 אלף טוקנים. הוא פונה למי שצריך לנתח מסמכי ענק או לבצע משימות תכנות ארוכות בלי לקרוס בעלויות חישוב.

  • 456Bפרמטרים
  • 10,240,000טוקנים בהקשר
  • 850 GBמשקל הקבצים
  • 1,259הורדות בחודש

מה זה

מדובר במודל שכולל 456 מיליארד פרמטרים בסך הכול, מתוכם 45.9 מיליארד פעילים בכל טוקן בזכות ארכיטקטורת תערובת מומחים. השילוב בין מנגנון תשומת לב היברידי בשם lightning attention לבין אימון בלמידת חיזוק מקנה לו יכולת לחשוב לעומק בלי להכפיל את המשאבים בצורה ליניארית, ומאפשר לו לחסוך 75 אחוז מחישובי ה־FLOPs בהשוואה ל־DeepSeek R1 בייצור של מאה אלף טוקנים.

במבחני ביצועים הוא עומד על 86 במתמטיקה של AIME 2024, ומשיג 56 אחוז ב־SWE-bench Verified לפתרון תקלות תוכנה אמיתיות. במבחני הקשר ארוך כמו OpenAI-MRCR על 128 אלף טוקנים הוא מציג 73.4 אחוז, הרבה מעל המתחרים הישירים בקוד פתוח. היתרון המרכזי שרואים בדוחות מתבטא בעיקר בשימוש בכלים וקריאות לפונקציות, שם קיבל 62 ו־63.5 אחוז במבחני TAU-bench.

מתאים ל

  • פתרון באגים במאגרי קוד

    תוצאה של 56 אחוז ב־SWE-bench מאפשרת לו לאתר תקלות בקבצים מרובים ולבצע תיקוני תוכנה מורכבים.

  • ניתוח מסמכים ארוכים

    חלון הקשר של מיליון טוקנים מאפשר לבלוע ספריות שלמות, מפרטים טכניים או דוחות עמוסי מידע בבת אחת.

  • סוכני אוטומציה מבוססי כלים

    ביצועים יציבים ב־TAU-bench ותמיכה מובנית ב־function calling מאפשרים הפעלת ממשקים חיצוניים.

איפה זה נופל

הנתון הבעייתי ביותר בדוחות של המודל הוא Factuality, שם במבחן SimpleQA הוא מקבל רק 18.5 אחוז. המודל נוטה להזיות כשהוא נדרש לשלוף עובדות פשוטות מהזיכרון בלי הקשר ישיר. בנוסף, במבחן HLE הטקסטואלי ללא כלים הוא מקבל רק 8.4 אחוז, שזה ציון נמוך מאוד. אסור להשתמש בו כמקור ידע אנציקלופדי או במערכות רפואיות ומשפטיות בלי אימות חיצוני צמוד.

אותה משפחה

MiniMax-M1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת יחיד עם כרטיס RTX 4090?

לא. המודל שוקל 850 גיגה בייט ודורש אשכול שרתי GPU ברמת enterprise עם נפח זיכרון עצום של טרה בייט לפחות. הרצה מקומית על חומרה ביתית או שרת פיתוח בודד פשוט בלתי אפשרית טכנית.

איך צריך לקנפג את הפרמטרים בשביל לקבל תוצאות טובות?

היוצרים ממליצים להגדיר temperature לערך של 1.0 ו־top_p לערך של 0.95. ההגדרות האלה מאפשרות למודל לחקור מסלולי פתרון מגוונים בלי להיתקע בחזרתיות בזמן החשיבה הממושכת.

איך מריצים

משקל המשקולות עומד על 850 גיגה בייט המחולקים ל־434 קבצים. כדי להרים מפלצת כזו בתשתית מקומית צריך אשכול שרתים רציני עם כמה מאיצי H100 או A100 בעלי זיכרון VRAM מצטבר של טרה בייט לפחות, לצד תמיכה ב־vLLM מגרסה 0.9.2 ומעלה. מי שאין לו גישה לחוות שרתים ייעודית פשוט יבזבז ימים רק על הורדת המשקולות.

גרסת ה־80k כוללת תקציב חשיבה ארוך פי שניים מגרסת ה־40k, מה שמוביל לשיפור קל בדיוק אבל מאריך את זמני המענה. לרוב המפתחים והצוותים המקומיים אין שום היגיון כלכלי להריץ מודל במשקל 850 גיגה לבד, ועדיף להתחבר ישירות ל־API שהחברה מציעה בפלטפורמה שלה.

from transformers import pipeline

pipe = pipeline("text-generation", model="MiniMaxAI/MiniMax-M1-80k")
print(pipe("שלום"))

הקבצים

434 קבצים במאגר, 850 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצר בלי לשלם תמלוגים, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗