GPT
M

MiMo-V2.5-ASR

קוד פתוח

XiaomiMiMomit2026-04-23

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • text-generation-inference

מודל תמלול קול של שיאומי שמיועד להתמודד עם דיבור רועש, מעורב באנגלית וסינית, וניבים סיניים שונים. שווה לבדוק אותו אם תמלול רגיל נכשל אצלכם ברקע רועש או בשיחות מרובות דוברים.

  • 7.6Bפרמטרים
  • 8,192טוקנים בהקשר
  • 29.9 GBמשקל הקבצים
  • 6,405הורדות בחודש

מה זה

המודל הזה נבנה כמערכת תמלול מקצה לקצה שמבוססת על מודל שפה סיבתי עם 36 שכבות. הוא מכוון לתרחישים קשים באודיו, כמו שיחות מרובות משתתפים שקוטעים זה את זה, תמלול של שירים עם מוזיקת רקע, וערבוב מהיר של אנגלית ומנדרינית בלי צורך בהגדרת שפה מראש. בנוסף הוא מייצר פיסוק ישירות מההקשר ומהאינטונציה של ההקלטה, כך שהפלט מגיע כטקסט קריא ולא כרצף מילים גולמי.

המפתחים בחנו אותו מול מבחנים סטנדרטיים באנגלית מורכבת וסביבות פנימיות, ומדווחים על יכולת דיוק גבוהה בעומס אקוסטי ובהקלטות שדה רחוק. השליטה שלו בדיאלקטים סיניים כוללת קנטונזית, וו, הוקיין וסצ'ואנזית לצד אנגלית ומנדרינית. מחוץ לשפות האלה אין לו שימוש, ולכן מי שמחפש פתרון לעברית או לשפות אירופיות אחרות יצטרך לוותר.

מתאים ל

  • תמלול ישיבות באנגלית

    מתאים לשיחות עבודה מרובות משתתפים עם דיבור חופף ורעשי רקע שמאפיינים פגישות משרדיות.

  • זיהוי דיבור מעורב

    קולט ערבוב חופשי וספונטני של משפטים בין אנגלית למנדרינית בלי להגדיר תגיות שפה מראש.

  • חילוץ מילים משירים

    מתוכנן לתמלל שירה בצורה מדויקת גם כשיש ליווי מוזיקלי רועש שמקשה על מודלים רגילים.

איפה זה נופל

החיסרון המרכזי למפתח הישראלי הוא השפות, המודל מאומן על מנדרינית, אנגלית וניבים סיניים בלבד, ואינו תומך בעברית כלל. בנוסף, חלון ההקשר מוגבל ל־8,192 טוקנים של אודיו וטקסט, כך שהקלטות ארוכות מאוד כמו ישיבות של כמה שעות ידרשו חיתוך ידני למקטעים. כדי להגיע לביצועים סבירים ההרצה מחייבת הידור של פלאש אטנשן וספריות תלויות, מה שמסבך את ההטמעה בסביבות ייצור רגילות.

שאלות
נפוצות

האם אפשר לתמלל איתו הקלטות בעברית?

לא. המודל אומן ותומך רק באנגלית, מנדרינית ומספר ניבים סיניים. הוא לא יזהה עברית ולא יפיק ממנה פלט שימושי.

מה צריך להוריד חוץ ממשקלי המודל עצמם?

חובה להוריד גם את החבילה הנפרדת של הטוקנייזר, שנקראת MiMo-Audio-Tokenizer. הקוד המובנה של המודל לא יכול לפענח את קובצי השמע בלעדיה.

איך מריצים

כדי להריץ אותו צריך סביבת לינוקס עם פייתון 3.12, תמיכה בגרסת קודה 12.0 ומעלה, והתקנה של פלאש אטנשן 2.7.4.post1. מעבר לקובצי המודל עצמם, ששוקלים יחד 29.9 גיגה בייט, חובה להוריד בנפרד גם את הטוקנייזר הייעודי של הפרויקט. מודל בגודל של 7.6 מיליארד פרמטרים דורש כרטיס גרפי חזק עם זיכרון וידאו משמעותי כדי להיטען ולעבד אודיו בצורה סבירה.

הקוד כולל ממשק גרדיו מקומי לבדיקות מהירות, וגם קריאה ישירה בפייתון שמחזירה את הטקסט ישירות מקובץ קול. אם אין לכם שרת עם מאיץ גרפי מתאים וייעודי לתהליך, להרים תשתית מקומית בשביל כמה עשרות הקלטות בודדות ידרוש הרבה יותר מדי התעסקות.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="XiaomiMiMo/MiMo-V2.5-ASR")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗