GPT
M

MiMo-Audio-7B-Instruct

קוד פתוח

XiaomiMiMomit2025-09-18

  • safetensors
  • qwen2
  • Audio-to-Text
  • Text-to-Audio
  • Audio-to-Audio

מודל קול פתוח שמתמודד ישירות עם הבנה ויצירת דיבור. הוא מביא יכולות שיחה קולית וטקסט לדיבור בלי צורך בשרשור מערכות נפרדות.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 6,134הורדות בחודש

מה זה

מדובר במודל שפת אודיו שעבר אימון הוראות ומבוסס על שילוב של טוקנייזר ייעודי, מקודד ומפענח פאצ'ים. המבנה הזה מכווץ רצפי שמע לקצב של 6.25 הרץ עבור שפת הבסיס, ומפענח בחזרה לאודיו בקצב של 25 הרץ. שיאומי שילבו בו מנגנוני חשיבה עבור ניתוח ויצירת שמע, והוא מיועד לתפקד כמערכת שמקבלת ומוציאה אודיו וטקסט באופן ישיר.

במבחני ביצועים של הבנת שמע, דיאלוג מדובר ומשימות טקסט לדיבור מונחות הוראות, גרסת ההוראות הזו הגיעה לתוצאות מובילות בקטגוריית הקוד הפתוח. המשמעות בפועל היא יכולת לנהל שיחה קולית רציפה ולהגיב להוראות מורכבות בלי להישען על מודל טקסט חיצוני באמצע.

מתאים ל

  • סוכני שיחה קוליים

    ניהול אינטראקציה מדוברת ישירה ללא המרה כפולה לטקסט וחזרה.

  • הפקת דיבור לפי הוראות

    יצירת שמע עם שליטה בסגנון ובטון על בסיס הנחיות טקסטואליות.

  • ניתוח והבנת שמע

    עיבוד קבצי אודיו והפקת תשובות לשאלות על תוכן השיחה.

איפה זה נופל

חלון ההקשר מוגבל ל־8,192 טוקנים, מה שמציב גבול ברור לאורך השיחה והשמע שאפשר להזין בבת אחת. למרות שיש תמיכה ביצירת דיאלוגים והבנה, אין בתיעוד שום מידע על תמיכה בשפות שאינן אנגלית או סינית, כך שעבור עברית כנראה תיתקלו בחוסר הבנה או פלט משובש. בנוסף, חובת השימוש בטוקנייזר חיצוני מסבכת את כל תהליך ההטמעה.

אותה משפחה

MiMo-Audio יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ רק את קובצי המודל האלה ולקבל שמע?

לא. המודל מחייב שימוש מקביל בטוקנייזר MiMo-Audio-Tokenizer שפורסם בנפרד. בלי הטוקנייזר אין דרך להמיר את קלט האודיו לטוקנים ובחזרה לגל קול.

האם המודל עובד בעברית?

דפי הפרויקט והדוחות לא מפרטים תמיכה בשפות אחרות מעבר לאנגלית ולסינית. סביר מאוד שעבור דיבור והבנה בעברית תצטרכו לאמן אותו מחדש או לבדוק אותו ישירות לפני כל שימוש.

איך מריצים

המשקל של הקבצים עומד על 15.0 גיגה בייט בדיוק bfloat16, אבל כדי להריץ אותו צריך להוריד גם את הטוקנייזר הנפרד שמחזיק עוד 1.2 מיליארד פרמטרים. ההרצה דורשת סביבת לינוקס, פייתון 3.12, CUDA 12.0 ומעלה, והתקנה של ספריית flash-attn בגרסה ספציפית.

שיאומי מספקים סקריפט הדגמה מבוסס ממשק גרדיו וסקריפטים לאינפרנס ישיר. אם אין לכם כרטיס גרפי מתאים לתמיכה במודל כזה יחד עם רכיב הטוקנייזר הנוסף, עדיף להמתין לממשקי ענן במקום להסתבך עם התקנות מקומיות.

pip install -U huggingface_hub
hf download XiaomiMiMo/MiMo-Audio-7B-Instruct

הרישיון

הרישיון הוא רישיון MIT. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות את הקוד ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית בתוך המוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗