GPT
M

MiniMax-M3-GGUF

קוד פתוח

unslothother2026-06-12

  • transformers
  • gguf
  • multimodal
  • moe
  • agent

גרסת GGUF ניסיונית למודל ענק עם מולטימודליות מובנית והקשר של מיליון טוקנים. הוא מיועד למי שחייב להריץ מודל סוכנים וכתיבת קוד מקומית ולא רוצה לשלוח נתונים החוצה.

  • 5.6 TBמשקל הקבצים
  • 5,716הורדות בחודש
  • 158לייקים

מה זה

מדובר במודל MoE עם כ־428 מיליארד פרמטרים בסך הכול, אבל רק 23 מיליארד פעילים בכל טוקן מתוך 128 מומחים. הוא אומן מההתחלה על טקסט, תמונה ווידאו יחד, ולא קיבל תוספת ראייה מאוחרת, מה שאמור לתת חיבור עמוק יותר בין המדיות השונות.

הוא מגיע עם חלון הקשר של מיליון טוקנים ושני מצבי עבודה, אחד עם חשיבה מעמיקה למשימות סוכנים ופתרון בעיות ארוכות, והשני רגיל לשיחה מהירה והשלמת קוד. הארכיטקטורה המקורית כוללת מנגנון קשב דליל בשם MSA שמאיץ ביצועים בהקשרים ארוכים פי 9 בהזנה ופי 15 בפענוח מול הדור הקודם, אבל בגרסת ה־GGUF הזו המנגנון הזה עדיין לא פועל ומערכת הריצה חוזרת לקשב צפוף רגיל.

מתאים ל

  • סוכנים ומשימות קוד ארוכות

    יש לו מצב חשיבה ייעודי ויכולת עבודה שתוכננה למשימות שדורשות תכנון רב שלבי ורצף פעולות ממושך.

  • ניתוח מסמכים ווידאו

    הוא כולל תמיכה מובנית בווידאו וטקסט עם חלון הקשר עצום של מיליון טוקנים שמתאים לקבצים גדולים במיוחד.

  • השלמת קוד בזמן אמת

    מצב העבודה ללא חשיבה מתאים לתרחישים שבהם מהירות התגובה קריטית ואפשר להסתפק ב־23 מיליארד פרמטרים פעילים.

איפה זה נופל

התמיכה בפורמט GGUF מוגדרת רשמית כניסיונית בלבד. החיסרון הגדול ביותר כרגע הוא חוסר התמיכה במנגנון ה־Sparse Attention ב־llama.cpp, מה שמאלץ את המנוע לעבוד בקשב צפוף רגיל. זה פוגע ישירות ביתרון המרכזי של המודל בהקשרים ארוכים ויוצר עומס חישובי כבד בהרבה ממה שהארכיטקטורה אמורה לדרוש. בנוסף, נדרשת ספריית transformers בגרסה 4.52.4 לפחות עם הרשאת קוד מרוחק כדי לטעון אותו.

שאלות
נפוצות

אפשר להריץ אותו על מחשב אישי רגיל?

לא. מדובר במודל של כ־428 מיליארד פרמטרים שדורש מאות גיגה־בייט של זיכרון גרפי או זיכרון RAM, גם כשמשתמשים בגרסאות מכווצות מאוד. מחשב שולחני סטנדרטי פשוט ייחנק מחוסר זיכרון.

האם גרסת ה־GGUF הזו יציבה למוצר קיים?

ממש לא. התמיכה ב־llama.cpp עדיין תלויה בקוד שנמצא ב־Pull Request ולא שוחרר לגרסה רשמית, ומנגנון הקשב היעיל של המודל עדיין לא נתמך בה. כדאי להתייחס לזה כאל ניסוי בלבד.

איך מריצים

כדי להריץ אותו דרך llama.cpp צריך לקמפל ידנית ענף ספציפי מתוך pull request פתוח, מספר 24523, כי התמיכה עדיין ניסיונית ולא נכנסה לגרסה הרשמית. אפשרות נוספת היא שימוש ב־Unsloth Studio שבו יש תמיכה מובנית.

המשקל הכולל של הקבצים במאגר מגיע ל־5.6 טרה־בייט והמודל עצמו ענק. תצטרכו לפזר אותו על פני כמה מעבדים גרפיים חזקים מאוד עם המון זיכרון, או לחלופין לטעון משקלים מכווצים כמו קוונטיזציית 1-ביט לתוך זיכרון ה־RAM של המעבד המרכזי. אם אין לכם שרת ייעודי עם מאות גיגה־בייט של זיכרון עבודה, יהיה הרבה יותר הגיוני וזול להשתמש ב־API הרשמי של MiniMax במקום להיאבק בהרצה מקומית.

ollama run hf.co/unsloth/MiniMax-M3-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

161 קבצים במאגר, 5.6 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון קהילתי ייעודי בשם MiniMax Community License ולא תחת רישיון קוד פתוח סטנדרטי כמו Apache או MIT. לפני שאתם משלבים אותו במוצר מסחרי או מפיצים אותו, חובה לבדוק ישירות את תנאי הרישיון המקוריים שלו כדי לוודא שאין שם הגבלות שימוש, מכסות משתמשים או דרישות דיווח לחברה.

הרישיון המלא בעמוד המודל ↗