GPT
M

MiMo-V2.5-GGUF

קוד פתוח

unslothmit2026-05-09

  • gguf
  • multimodal
  • unsloth
  • vision-language
  • audio

מודל ענק רב-אופני שמבין טקסט, תמונה, וידאו ושמע בארכיטקטורת מומחים. הגרסה הזו מכוונת למי שרוצה קבצי GGUF מכוילים להרצה מקומית, אבל יש לה מחיר כבד באחסון.

  • 4.1 TBמשקל הקבצים
  • 2,564הורדות בחודש
  • 47לייקים

מה זה

מדובר במודל MoE עם 310 מיליארד פרמטרים בסך הכול שמפעיל 15 מיליארד בכל טוקן, מאומן על כ־48 טריליון טוקנים. הוא משלב מפענחי ראייה של 729 מיליון פרמטרים ומפענח שמע של 261 מיליון, לצד חלון הקשר ענקי שמגיע עד מיליון טוקנים. השילוב בין מנגנון תשומת לב בחלון מחליק לתשומת לב מלאה ביחס של 5 ל־1 מצמצם את תפיסת הזיכרון של המטמון כמעט פי שישה.

במקום להישען על מודל שפה שמחובר בטלאים לקלט חיצוני, הארכיטקטורה הזו נבנתה מראש לעיבוד משולב של כל המדיות יחד עם יכולות הרצת סוכנים ותכנות. מנגנון של חיזוי מרובה טוקנים בשלוש שכבות מאפשר לו לקצר את זמני ההסקה, במיוחד בתרחישים של חלונות הקשר ארוכים מאוד שבהם מודלים מסורתיים נחנקים תחת עומס הזיכרון.

מתאים ל

  • ניתוח תהליכי שמע ווידאו

    מפענחי השמע והראייה המובנים מעבדים מדיה לצד טקסט באותה הסקה, בלי צורך במודלים נפרדים.

  • עבודה עם מסמכי ענק

    חלון של עד מיליון טוקנים עם מנגנון שחוסך זיכרון מאפשר תחקור קבצי ענק וקוד בסריקה אחת.

  • הפעלת סוכנים אוטונומיים

    האימון כלל למידת חיזוק למשימות מורכבות, מה שמתאים להרצת רצפי פקודות ותכנות באנגלית.

איפה זה נופל

המודל אומן רשמית רק על אנגלית וסינית. הוא לא מיועד לעברית, וללא בדיקה יסודית סביר להניח שיתקשה בדקויות שפה מקומיות. נקודה קריטית נוספת היא שגיאת תצורה בקבצי ההגדרות המקוריים שפורסמה בכרטיס, שמחייבת עדכון של קובצי התצורה כדי למנוע ירידה בביצועים. מעבר לכך, התמונות שמציגות את ציוני המבחנים בדף המקור מובאות ללא נתונים מספריים גלויים בטקסט, כך שאי אפשר לאמת באופן עצמאי את הביצועים המדויקים במשימות שונות.

שאלות
נפוצות

האם המודל יפעל טוב בעברית?

הכרטיס מציין תמיכה רשמית באנגלית ובסינית בלבד. הוא לא עבר אימון ייעודי לעברית, ולכן לא מומלץ להסתמך עליו במוצר שמיועד לשוק המקומי ללא בדיקות מעמיקות מראש.

איך אפשר להריץ אותו בלי לשבור את תבנית השיחה?

המפרסמים מציינים מפורשות שבשימוש ב־llama.cpp יש להוסיף את הפרמטר jinja בהרצה. בנוסף, יש לוודא שהורדתם את קובצי ה־config המעודכנים כדי למנוע פגיעה בביצועים.

איך מריצים

הריפו הזה מחזיק מעל 4 טרה-בייט של קבצים בפורמט GGUF של Unsloth. כדי להריץ משקלים בסדר גודל כזה, גם בגרסאות מכווצות ועם 15 מיליארד פרמטרים פעילים בלבד, תצטרכו שרת עם מאגר זיכרון רחב מאוד של VRAM או חומרה ייעודית מרובת מאיצים.

לשימוש מקומי עם llama.cpp חובה להעביר את הדגל jinja כדי שהתבנית תעבוד נכון, ויש פתרונות פריסה רשמיים עם vLLM ו־SGLang. בהתחשב בגודל האחסון והדרישות החישוביות, אם המטרה היא בדיקה ראשונית או סביבת פיתוח קלה, זול ויעיל בהרבה לגשת ל־API הרשמי של שיאומי במקום להחזיק תשתית כבדה.

ollama run hf.co/unsloth/MiMo-V2.5-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

123 קבצים במאגר, 4.1 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון MIT. זהו רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי, הפצה ושילוב במוצרים פרטיים בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗