GPT
M

MiMo-V2-Flash

קוד פתוח

XiaomiMiMomit2025-12-16

  • transformers
  • safetensors
  • mimo_v2_flash
  • text-generation
  • conversational

מודל ענק בתצורת מומחים שמפעיל רק 15 מיליארד פרמטרים בפועל. הוא מתאים למי שמחפש ביצועי תכנות וסוכנים חזקים עם חלון הקשר ענקי וזמני ריצה מהירים.

  • 310Bפרמטרים
  • 262,144טוקנים בהקשר
  • 292 GBמשקל הקבצים
  • 93,287הורדות בחודש

מה זה

מדובר במודל MoE שמחזיק 309 מיליארד פרמטרים בסך הכל, אך בכל צעד חישוב משתמש ב־15 מיליארד בלבד. השילוב הזה נותן לו לשמור על משקל תגובה קל ומהיר יחסית להיקף המידע שהוא מכיל. הוא נבנה עם ארכיטקטורת קשב מעורבת שמצמצמת את תפיסת הזיכרון של ה־KV cache כמעט פי שישה, ומנגנון חיזוי מרובה טוקנים שמאיץ את הפקת הפלט.

התוצאות במבחני הביצועים מציבות אותו גבוה מאוד במשימות תכנות וחשיבה מורכבת. בגרסה שעברה אימון מתקדם הוא מגיע ל־73.4% ב־SWE-Bench Verified ו־94.1% ב־AIME 2025, מספרים שמציבים אותו קרוב מאוד למודלים המובילים בשוק בתחומים האלה, במיוחד במענה לסוכנים אוטומטיים והפעלת כלים.

מתאים ל

  • סוכני תכנות אוטונומיים

    הוא מגיע לתוצאה של 73.4% ב־SWE-Bench Verified ומותאם לרוץ בסביבות פיתוח מורכבות.

  • ניתוח מסמכים ואגים ארוכים

    תמיכה בחלון של עד 256 אלף טוקנים יחד עם ארכיטקטורת קשב חסכונית שמונעת חריגות זיכרון.

  • פתרון בעיות מתמטיקה

    ציון של 94.1% במבחן AIME 2025 מעיד על יכולת הסקה לוגית וחישובית גבוהה במיוחד.

איפה זה נופל

במשימות ידע כללי ושאלות עובדתיות ישירות המודל מציג ביצועים נמוכים בהרבה, עם 20.6% בלבד במבחן SimpleQA בגרסת הבסיס, פער משמעותי מול מודלים מתחרים. גם בבדיקות כתיבה תחת הנחיות קשות הוא מקבל 54.1% בלבד ב־Arena-Hard.

בנוסף, בעבודה עם סוכנים מרובי שלבים חובה לשמור ולהעביר מחדש את כל היסטוריית החשיבה בתוך המערך בכל קריאה עוקבת, אחרת שרשרת ההקשר נשברת והוא מתקשה לעקוב אחרי הפורמט הנדרש.

אותה משפחה

MiMo-V2-Flash יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על שרת פיתוח סטנדרטי עם כרטיס יחיד?

לא. מדובר במודל של 309 מיליארד פרמטרים ששוקל 292 ג'יגה בייט, כך שהוא לא ייכנס לשום כרטיס מסך בודד שקיים כיום בשוק. תצטרכו שרת מרובה כרטיסים או מערך שמשלב פריקה למעבד וזיכרון RAM גדול.

איך צריך לקנפג את הטמפרטורה כדי לקבל תוצאות טובות?

היוצרים ממליצים להשתמש ב־top_p של 0.95. לגבי טמפרטורה, מומלץ להגדיר 0.8 למשימות כתיבה, מתמטיקה ופיתוח אתרים, ולהוריד ל־0.3 במשימות סוכנים והפעלת כלים.

איך מריצים

המשקל הכולל של הקבצים עומד על 292 ג'יגה בייט בפורמט bfloat16, כך שלהריץ אותו באופן מלא דורש שרת עם מספר מעבדים גרפיים חזקים ותמיכה ב־SGLang. אפשרות נוספת שהיוצרים מציעים היא הרצה באמצעות KTransformers לפריקה למעבד מרכזי, שם מערך של ארבעה כרטיסי RTX 5090 ושני מעבדי AMD EPYC 9355 מגיע לקצב של כ־35.7 טוקנים לשנייה.

אם אין לכם תשתית שרתים מקומית של כמה עשרות אלפי דולרים לפחות, אין טעם לנסות להרים אותו על מחשב בודד. במקרים כאלה עדיף בהרבה להשתמש ב־API שהחברה מציעה בפלטפורמה שלה.

from transformers import pipeline

pipe = pipeline("text-generation", model="XiaomiMiMo/MiMo-V2-Flash")
print(pipe("שלום"))

הקבצים

157 קבצים במאגר, 292 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון MIT. זהו רישיון קוד פתוח מתירני לחלוטין שמאפשר שימוש מסחרי, שינוי של המשקלים, הפצה ושילוב במוצרים סגורים בלי תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗