GPT
M

AesSedai/MiMo-V2.5-GGUF

קוד פתוח

AesSedaiרישיון לא דווח2026-04-29

  • gguf
  • endpoints_compatible
  • imatrix
  • conversational

גרסת GGUF ייעודית למודל MiMo-V2.5 של שיאומי, שמכוילת למנוע Llama.cpp. היא כוללת קוונטיזציה מיוחדת לשכבות ה־MoE כדי לחסוך מקום בלי לרסק את איכות הטקסט.

  • 948 GBמשקל הקבצים
  • 1,136הורדות בחודש
  • 43לייקים

מה זה

הפרויקט הזה מביא המרה ממוקדת טקסט של המודל MiMo-V2.5 מבית שיאומי לפורמט GGUF. במקום לכווץ את כל המשקלים באותה צורה, המפתח בנה תמהיל קוונטיזציה חכם שמשאיר את השכבות הרגישות באיכות גבוהה ודוחס בעיקר את שכבות ה־FFN הגדולות של ה־MoE. זה מאפשר לקבל תוצאות מדויקות יותר ביחס לגודל הקובץ.

מבחני ה־PPL וה־KLD המוצגים מראים שהגרסאות שומרות על רמת שגיאה נמוכה יחסית לבסיס. למשל, גרסת Q4_K_M שוקלת כ־177 גיגה-בייט ומציגה סטייה של כ־1.4% בלבד ב־PPL, בעוד שגרסת IQ3_S הקטנה ביותר יורדת ל־106 גיגה-בייט אבל משלמת בקפיצה של מעל 8% ב־PPL.

מתאים ל

  • עיבוד טקסט כבד מקומית

    מתאים לניתוח טקסטים מורכבים בארגון עם שרתי GPU חזקים בלי להוציא נתונים החוצה.

  • בדיקות קוונטיזציה ל־MoE

    שימושי למפתחים שרוצים לבחון השפעה של דחיסת משקלי FFN מול שמירה על איכות.

  • הרצה מהירה ב־llama.cpp

    מיועד למי שמריץ עם Flash Attention עדכני בתוך סביבת llama.cpp מקומפלת מהמאסטר.

איפה זה נופל

הקובץ הנוכחי מוגבל לעיבוד טקסט בלבד. למרות שמודל המקור כולל יכולות ראייה וקול, הן אינן זמינות בגרסת ה־GGUF הזו עד שתוטמע תמיכה מלאה ב־llama.cpp הרשמי, אם כי יש ענפי פיתוח ניסיוניים לכך. בנוסף, בגרסאות הדחוסות מאוד כמו IQ3_S יש פגיעה מורגשת ברמת הדיוק והשפה לפי מדדי ה־PPL.

שאלות
נפוצות

האם המודל תומך בתמונות או אודיו?

לא, הגרסה הזו כוללת תמיכה בטקסט בלבד. תמיכת מולטימדיה עדיין מוגדרת כעבודה בתהליך בענפי פיתוח נפרדים ואינה חלק מהקבצים המרכזיים.

איזו גרסה מומלצת להרצה מאוזנת?

גרסת Q4_K_M מציעה יחס טוב בין נפח של כ־178 גיגה-בייט לבין עלייה מתונה מאוד של כ־1.4% בלבד במדד השגיאה PPL ביחס למקור.

איזה ענף של llama.cpp צריך לקמפל בשביל זה?

השינויים כבר מוזגו לענף הראשי של llama.cpp, כולל שיפורי Flash Attention, ולכן מספיק למשוך את גרסת המאסטר העדכנית ולקמפל.

איך מריצים

להריץ את זה דורש חומרה כבדה מאוד, שכן הגרסה הקלה ביותר, IQ3_S, שוקלת מעל 106 גיגה-בייט, וגרסת Q8_0 מגיעה ליותר מ־306 גיגה-בייט. תצטרכו שרת עם מארז כרטיסי מסך חזקים או שילוב של זיכרון מערכת ענק, ומומלץ לקמפל את הגרסה העדכנית ביותר של llama.cpp שכבר מכילה תמיכה מובנית ב־Flash Attention.

גרסאות ה־IQ מכווצות משמעותית את הדרישות, אבל אם אין לכם גישה לתשתית מקומית בקנה מידה כזה, החזקת המודל הזה עצמאית תהיה יקרה ומסורבלת בהשוואה לקריאה לשירות ענן.

ollama run hf.co/AesSedai/MiMo-V2.5-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

43 קבצים במאגר, 948 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצר לא דיווח על רישיון בעמוד המודל. במצב כזה אין אישור שימוש ברור, וזה מהווה סיכון משפטי ישיר למי שמתכנן לשלב אותו במוצר מסחרי או להפיץ אותו. כל שימוש מעבר לבדיקה פרטית מחייב בדיקה של רישיון המקור של שיאומי.

הרישיון המלא בעמוד המודל ↗