GPT
M

mimi

קוד פתוח

kyutaicc-by-4.02024-09-10

  • transformers
  • safetensors
  • mimi
  • feature-extraction
  • audio

מקודד אודיו עצבי קטן שדוחס דיבור לקצב של 1.1 קילוביט בשנייה. הוא משלב מידע אקוסטי וסמנטי יחד, ולכן מתאים במיוחד כבסיס למודלי שפה קוליים.

  • 96Mפרמטרים
  • 8,000טוקנים בהקשר
  • 367 MBמשקל הקבצים
  • 626,306הורדות בחודש

מה זה

מדובר במקודד אודיו עצבי שמיועד לעיבוד דיבור בארכיטקטורת קידוד ופענוח רציפה, מה שמאפשר לו לעבוד בהזרמה ישירה. הרעיון המרכזי כאן הוא שילוב של מידע אקוסטי יחד עם מידע סמנטי בתוך טוקנים קוליים שרצים בקצב נמוך מאוד של 12.5 הרץ. השילוב הזה נותן דחיסה משמעותית של 1.1 קילוביט בשנייה, תוך שמירה על איכות שמע גבוהה יחסית לנפח המידע.

בגודל של 96 מיליון פרמטרים בלבד, הוא לא מנסה להיות מודל שפה ענק שמבין שיחה אלא שכבת התשתית שממירה קול לייצוג ספרתי קומפקטי ובחזרה. הוא אומן על נתוני דיבור מקצה לקצה עם מרחב לטנטי מקוונטט, ולכן הוא רלוונטי במיוחד למי שבונה מערכות דיבור לטקסט, טקסט לדיבור, או מודלי דיאלוג קוליים שצריכים לרוץ מהר בלי לחנוק את רוחב הפס.

מתאים ל

  • דחיסת דיבור בזמן אמת

    דחיסה כבדה לקצב של 1.1 קילוביט בשנייה, שמתאימה לשידור קולי ברשתות עם רוחב פס מוגבל מאוד.

  • אימון מודלי שפה קוליים

    הפקת טוקנים בקצב 12.5 הרץ שמשלבים סמנטיקה ואקוסטיקה, מה שמקל על מודל שפה לייצר דיבור ישיר.

  • בניית מערכות דיבור לטקסט

    חילוץ מאפיינים איכותיים מאותות קול של דיבור כשלב מקדים למערכות זיהוי או תמלול.

איפה זה נופל

המודל מוגבל אך ורק לדיבור, ואומן להפיק קול יחיד בלבד כדי למנוע התחזות. היכולות שלו מוגבלות יחסית לפי דיווח המפתחים, ויש בו הטיות לנושאים מסוימים שנכחו יותר מדי במידע שבו השתמשו לאימון. בניתוח רעילות טקסטואלית הוא מתנהג בדיוק באמצע ביחס למודלים קיימים, כך שאין כאן חסינות מיוחדת מפני פלט בעייתי. הוא לא מתאים לעיבוד מוזיקה או רעשי רקע כלליים.

שאלות
נפוצות

האם המודל הזה מסוגל לנהל שיחה בעצמו?

לא, זהו מקודד אודיו שממיר גלי קול לטוקנים ובחזרה. כדי לנהל שיחה שלמה צריך לחבר אותו למודל שפה כמו Moshi, שעושה את החשיבה והפקת התוכן עצמו.

האם אפשר להשתמש בו לחיקוי קולות שונים?

לא, המפתחים הגבילו אותו במפורש להפקה של קול אחד בלבד כדי לצמצם שימוש לרעה והתחזות לקולות של אנשים אחרים.

איך מריצים

המשקל הכולל של הקבצים עומד על 367 מגה בייט עם 96 מיליון פרמטרים בדיוק של float32, כך שלא צריך מפלצת מחשוב בשבילו. כל כרטיס גרפי מודרני בסיסי יריץ אותו בקלות, ואפשר להריץ אותו אפילו על מעבד רגיל אם עובדים נכון. הוא נתמך ישירות בספריית transformers של פייתון ומגיע מתוך פרויקט Moshi של Kyutai.

אין שום סיבה אמיתית לחפש כאן שירות ענן חיצוני או API בתשלום. הגודל המזערי של המשקלים מאפשר להוריד את הקבצים ולשלב אותם ישירות בתוך הצינור המקומי שלכם בלי תקורת רשת.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="kyutai/mimi")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 367 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-4.0, רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי והפצה של המודל. התנאי היחיד הוא מתן קרדיט ברור למפתחים מ־Kyutai לפי דרישות הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗