GPT
M

MiniMax-M2-GGUF

קוד פתוח

unslothmit2025-11-01

  • transformers
  • gguf
  • minimax
  • unsloth
  • text-generation

גרסת GGUF למודל תערובת מומחים של 230 מיליארד פרמטרים עם 10 מיליארד פעילים בכל טוקן. הוא נועד למפתחים שרוצים ביצועי תכנות של מודל ענק עם זמני תגובה מהירים של מודל קטן.

  • 3.4 TBמשקל הקבצים
  • 1,984הורדות בחודש
  • 89לייקים

מה זה

המודל פותח סביב ארכיטקטורת תערובת מומחים שכוללת 230 מיליארד פרמטרים בסך הכול, אך מפעילה רק 10 מיליארד בכל רגע נתון. המבנה הזה מכוון ישירות לצווארי הבקבוק של סוכני קוד, שבהם נדרשות קריאות חוזרות ונשנות לסביבת הפעלה. על פי המדדים בכרטיס, המודל מתמחה בשרשראות עבודה ארוכות של הרצת פקודות בטרמינל, זיהוי שגיאות ותיקון עצמי של קבצים מרובים.

במבחני ביצועים מול מודלים מסחריים מובילים, הוא מציג ציון של 69.4 במבחן SWE-bench Verified וציון 83 במבחן LiveCodeBench. במבחני שימוש בכלים וחיפוש מידע, כמו BrowseComp ופתרון בעיות טרמינל, הוא משיג ציונים שמתחרים ישירות במודלים הגדולים ביותר, בזכות היכולת לשמור על עקביות לאורך לולאות בדיקה ארוכות.

מתאים ל

  • סוכן תיקון באגים בטרמינל

    הרצה אוטונומית של פקודות ובדיקות, קריאת פלט הטרמינל ותיקון שגיאות בקוד בסבבים מהירים.

  • עריכת קוד רב־קובצית במאגרים

    הבנת שינויים רוחביים בפרויקט, ביצוע עריכות על פני כמה קבצים במקביל ושמירה על מבנה הפרויקט.

  • אוטומציה של איסוף וחיפוש

    ניווט בין מקורות מידע ברשת, חילוץ עובדות מבוססות והתאוששות מכישלונות בטעינת דפים.

איפה זה נופל

במשימות שדורשות הבנה מדעית מורכבת או פתרון שאלות ברמת מומחה ללא עזרים חיצוניים, המודל מציג חולשה ברורה, עם ציון של 12.5 בלבד במבחן HLE ללא כלים וציון 36 ב־SciCode. בנוסף, מדובר במודל שחושב בצורה משולבת בתוך רצף השיחה, ולכן חובה לשמור את מקטעי החשיבה של העוזר בהיסטוריית ההודעות. אם המערכת שלכם חותכת או מנקה את מחשבות הביניים, הביצועים שלו בקוד ובכלים ייפגעו מיידית.

שאלות
נפוצות

האם אפשר להריץ את גרסת ה־GGUF הזו על מחשב נייד חזק?

לא. למרות שהמודל מפעיל רק 10 מיליארד פרמטרים בכל שלב, כל 230 מיליארד הפרמטרים צריכים להיטען לזיכרון העבודה. תצטרכו שרת עם מאות גיגה־בייט של זיכרון כדי להחזיק את המודל, כך שמחשב אישי אינו רלוונטי.

איך צריך לנהל את היסטוריית השיחה עם המודל בזמן פיתוח?

חובה להשאיר את שלבי החשיבה של המודל בתוך ההיסטוריה שנשלחת בכל פנייה. המודל מתבסס על המחשבות הקודמות שלו כדי להמשיך להריץ כלים ולכתוב קוד, ומחיקה שלהן פוגעת ישירות באיכות התוצאה.

איך מריצים

המשקל הכולל של הקבצים במאגר הזה מגיע ל־3.4 טרה־בייט ב־90 קבצים, נתון שמשקף את הגרסאות השונות שהועלו בפורמט GGUF. למרות שרק 10 מיליארד פרמטרים פעילים בכל רגע, כל 230 מיליארד הפרמטרים חייבים לשבת בזיכרון. הרצה עצמית דורשת שרת ייעודי מרובה כרטיסי מסך עם מאות גיגה־בייט של זיכרון מהיר, או שימוש בכלים כמו SGLang ו־vLLM התומכים בארכיטקטורה הזו.

לרוב המפתחים אין חומרה כזו במשרד או בענן פרטי זול. אם אתם צריכים את המודל למוצר או לבדיקות, פנייה ל־API הרשמי של MiniMax או שימוש בפלטפורמת הסוכנים שלהם תהיה כמעט תמיד זולה והגיונית יותר מאשר החזקת תשתית מקומית.

ollama run hf.co/unsloth/MiniMax-M2-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

90 קבצים במאגר, 3.4 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המאגר מפורסם תחת רישיון MIT. זהו רישיון קוד פתוח מתירני לחלוטין שמאפשר שימוש מסחרי, שינוי קוד, הפצה ושילוב במוצרים סגורים, ללא תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצי המקור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗