GPT
M

MiMo-V2.5-Pro-FP4-DFlash

קוד פתוח

XiaomiMiMomit2026-06-08

  • transformers
  • safetensors
  • mimo_v2
  • text-generation
  • agent

גרסת ענק מבוססת מומחים שמשלבת קוונטיזציה של FP4 עם מודל טיוטה מהיר. היא מיועדת למי שחייב מהירות גבוהה במיוחד בהקשרים ארוכים ובמשימות קוד.

  • 554Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 531 GBמשקל הקבצים
  • 540הורדות בחודש

מה זה

הארכיטקטורה כאן מחולקת בין עמוד שדרה עצום של מומחים לבין מודל טיוטה קטן של 5 שכבות. כדי לא לשבור את הביצועים של המודל בדיוקים נמוכים, רק המומחים עברו כיווץ לפורמט MXFP4, בזמן ששאר המודל נשאר בדיוק גבוה יותר. לצד זה רץ מנגנון שמנחש בלוק של שמונה טוקנים במקביל בפעימה אחת במקום לייצר טוקן אחרי טוקן, מה שמקצר את זמן ההמתנה של המודל הראשי.

במבחני סוכני קוד כמו SWE-bench Verified התוצאה עומדת על 77.4 לעומת 78.9 בגרסת ה־FP8, וב־Humanity's Last Exam יש ירידה מ־48 ל־47. המדידות מראות שהכיווץ ל־FP4 כמעט לא פוגע ביכולת הפתרון, ובמבחני קוד ופיתוח רשת המודל מצליח לאשר בין 4.2 ל־6.3 טוקנים בכל ניחוש של מודל הטיוטה.

מתאים ל

  • סוכני פיתוח תוכנה אוטונומיים

    תוצאה של 77.4 ב־SWE-bench ויכולת אישור של מעל 4 טוקנים במקביל בניתוח קוד.

  • ניתוח מסמכים באנגלית בהקשר ענק

    תמיכה בחלון הקשר של מיליון טוקנים עם מנגנון קשב בחלון נע שמאיץ את העיבוד.

  • שרתי הסקה עתירי עומס

    חיסכון ברוחב פס של הזיכרון בזכות FP4 בשילוב דחיפת טוקנים במקביל דרך SGLang.

איפה זה נופל

המודל אומן רק על אנגלית וסינית, כך שאין שום הבטחה או בדיקה לגבי עברית, והיא עלולה לצאת שבורה או חלשה מהותית. בנוסף, מנגנון הטיוטה המהיר יעיל בעיקר בקוד ובפיתוח רשת, אבל במשימות שיחה כלליות כמו MT-Bench אורך הבלוק המאושר צונח ל־3.18 טוקנים בלבד, מה שמוריד את יתרון המהירות שלו. כל הריצה תלויה בתמיכה טכנית מורכבת של SGLang ושל חומרה שיודעת לטפל ב־MXFP4.

שאלות
נפוצות

אפשר להריץ אותו על שרת יחיד עם 8 כרטיסים?

לא. המשקל לבדו הוא 531 גיגהבייט לפני חישובי הקשר, והגדרות ההפעלה הרשמיות מחייבות מקביליות של 16 כרטיסים על פני כמה שרתים ברשת מהירה.

האם המודל מבין ומייצר עברית?

התיעוד מגדיר תמיכה באנגלית ובסינית בלבד. הוא לא אומן או נבדק על עברית, וסביר להניח שאיכות הטקסט והקוד בעברית תהיה נמוכה מאוד.

מה נותן מודל הטיוטה DFlash לעומת מודל רגיל?

הוא מנחש קבוצה שלמה של 8 טוקנים בבת אחת, ועמוד השדרה רק בודק אותם. במשימות קוד זה מניב אישור של יותר מ־4 טוקנים בכל צעד ומקצר את זמן התגובה.

איך מריצים

אי אפשר להריץ את המפלצת הזו על שרת בודד פשוט. הקבצים שוקלים 531 גיגהבייט ודורשים פריסה מקבילית רחבה עם SGLang, שמשלבת חלוקת מומחים וחלוקת טנזורים על פני כמה שרתים עם כרטיסי מסך חזקים. פקודת ההרצה הרשמית מגדירה במפורש שילוב של 16 כרטיסים במקביל עם תקשורת רשת ייעודית.

אם אין לכם קלאסטר של עשרות כרטיסי שרת עם תמיכה בארכיטקטורת FP4 וזיכרון עצום, אין טעם לנסות להרים אותו מקומית. עדיף לפנות ל־API של היצרן או להשתמש בשירות ענן מנוהל שמחזיק את התשתית הזו מוכנה.

from transformers import pipeline

pipe = pipeline("text-generation", model="XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash")
print(pipe("שלום"))

הקבצים

52 קבצים במאגר, 531 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, וזה אומר חופש כמעט מוחלט. מותר לקחת את המשקולות, להריץ אותן במוצר מסחרי, לשנות את הקוד או למכור גישה למודל בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗