GPT
M

lukealonso/MiniMax-M2.7-NVFP4

קוד פתוח

lukealonsomit2026-04-12

  • safetensors
  • minimax_m2
  • custom_code
  • 8-bit
  • modelopt

גרסת קוונטיזציה של 4 ביט למודל MoE ענק, שנועדה לחסוך זיכרון בלי לרסק את הדיוק. שווה לבדוק אותה רק אם יש לכם חומרת Blackwell מתאימה ואתם צריכים חלון הקשר עצום.

  • 130Bפרמטרים
  • 196,608טוקנים בהקשר
  • 135 GBמשקל הקבצים
  • 4,295הורדות בחודש

מה זה

מדובר בהמרה של המודל MiniMax-M2.7 לפורמט NVFP4 שבוצע באמצעות NVIDIA Model Optimizer. המודל המקורי בנוי בתצורת Mixture-of-Experts עם 10 מיליארד פרמטרים פעילים מתוך עשרות מומחים, וכאן כיווצו רק את שכבות המומחים ל־4 ביט עם סקיילים ב־FP8, בעוד ששאר השכבות נשארו ב־BF16 כדי לשמור על יציבות.

הכיול נעשה על דאטה רחב שכולל קוד, פקודות וכלים, חשיבה רב-שלבית, מתמטיקה ואנגלית לצד סינית. במקום לכפות הפעלה של כל המומחים, הם נתנו לניתוב הטבעי לעבוד על כמות דגימות גדולה בהרבה מהרגיל, והעדכונים האחרונים הורידו את הסטייה במדידת KLD בעשרות אחוזים.

מתאים ל

  • עיבוד מסמכים ארוכים

    חלון של כמעט 200 אלף טוקנים מאפשר לקרוא קבצי קוד שלמים או תיעוד טכני כבד בבת אחת.

  • הפעלת כלים וסוכנים

    הכיול התמקד ב־Tool Calling ומאפשר לשלב את המודל בתהליכי אוטומציה שדורשים מבנה מדויק.

  • פתרון בעיות מתמטיקה וקוד

    מתאים למשימות פיתוח וחישוב שדורשות הסקת מסקנות בכמה שלבים עם ניתוב מומחים מהיר.

איפה זה נופל

יש פה באג ידוע שגורם להופעת רווחים מיותרים אחרי סימני פיסוק, והיוצר ממליץ לשנמך את ספריית transformers לגרסה 0.4.67 אם זה קורה. בנוסף, מדובר בפורמט ייעודי שתלוי בתמיכת חומרה חדשה מאוד, כך שאי אפשר להריץ אותו על רוב השרתים שקיימים כרגע בשוק. חשוב גם לבדוק את התנהגות המודל בעברית, כי נתוני הכיול התמקדו רק באנגלית ובסינית.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי מסך ישנים יותר מסדרת Ada או Hopper?

לא מומלץ ואולי אף בלתי אפשרי. הפורמט NVFP4 דורש תמיכת ארכיטקטורה שנבדקה על כרטיסי Blackwell, כך שעל כרטיסים ישנים תקבלו שגיאות או ביצועים נוראיים.

למה מופיעים לי רווחים מוזרים אחרי נקודות ופסיקים בפלט?

זו בעיה מוכרת שצוינה בתיעוד. הפתרון שהמפתח מציע הוא לבצע שנמוך של ספריית transformers לסביבת עבודה בגרסה 0.4.67.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־135 ג'יגה-בייט שמחולקים ל־61 חלקים. כדי להריץ את זה בפועל תצטרכו חומרת Blackwell, והמפתח בדק את זה ספציפית על מערכים של שניים או ארבעה כרטיסי RTX Pro 6000 Blackwell. על חומרה מדור קודם או כרטיסים ביתיים רגילים פשוט אין מה לנסות להרים את זה.

אם אין לכם גישה לשרת עם כרטיסי Blackwell ייעודיים, עדיף להשתמש ב־API של המודל המקורי. להחזיק תשתית כזאת עצמאית עולה הון, וזה משתלם רק אם יש לכם דרישות פרטיות מוחלטות שמונעות הוצאת מידע החוצה.

pip install -U huggingface_hub
hf download lukealonso/MiniMax-M2.7-NVFP4

הקבצים

61 קבצים במאגר, 135 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש ולשלב אותו במוצרים שלכם בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והרישיון בתוך הקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗