GPT
W

wavlm-base-plus-sv

קוד פתוח

microsoftרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • wavlm
  • audio-xvector
  • speech

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל קומפקטי של מיקרוסופט לאימות דוברים והפקת וקטורי זהות קוליים מקבצי אודיו. הוא מגיע כבר מאומן למשימה וחוסך אימון יקר מאפס.

  • 386 MBמשקל הקבצים
  • 236,003הורדות בחודש
  • 57לייקים
  • 12שכבות

מה זה

מדובר במודל שמבוסס על ארכיטקטורת WavLM עם ראש X-Vector, שמיועד לזהות מי מדבר ולא מה נאמר. הוא עבר אימון מקדים על 94 אלף שעות של דיבור באנגלית ממאגרים שונים כמו Libri-Light, GigaSpeech ו־VoxPopuli, תוך שילוב דגימות קול חופפות כדי לעזור לו להבדיל טוב יותר בין דוברים.

אחרי האימון המקדים, מיקרוסופט ביצעו לו fine-tuning ישירות על מאגר VoxCeleb1 עם פונקציית Additive Margin Softmax. התוצאה היא מודל שיודע להמיר קטע דיבור לווקטור מאפיינים יציב, כזה שאפשר להשוות לקטעים אחרים כדי לאמת זהות דובר.

מתאים ל

  • אימות זהות קולית

    הפקת וקטור זהות מדגימת קול כדי לוודא שמדובר באותו משתמש במערכות כניסה או תמיכה.

  • הפרדת דוברים בהקלטה

    חילוץ ייצוגי קול מקטעים שונים בשיחה כדי לדעת איזה חלק שייך לכל משתתף.

  • חיפוש קטעים לפי דובר

    השוואת וקטורי קול בארכיון אודיו כדי לאתר את כל הקטעים שבהם מופיע אדם מסוים.

איפה זה נופל

הוא לא מתמלל מילים ולא כולל טוקנייזר. אם המטרה היא להמיר דיבור לטקסט, תצטרכו להוסיף טוקנייזר ולאמן אותו מחדש על דאטה מתויג. בנוסף, האימון נעשה כולו על אנגלית, ולכן ביצועי הזיהוי שלו על שפות אחרות או על עברית במבטא מקומי דורשים בדיקה זהירה לפני שסומכים עליהם.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות לתמלול הקלטות?

לא. המודל עבר fine-tuning לאימות דוברים בלבד ולא מכיל טוקנייזר לטקסט. כדי להפוך אותו למודל תמלול יש צורך לבנות שכבת פלט מתאימה ולאמן אותו מחדש על טקסט.

מה לעשות אם קובץ האודיו שלי לא נדגם ב־16kHz?

חייבים להמיר אותו מראש ל־16kHz לפני שמעבירים אותו למודל. המודל אומן ספציפית על הקצב הזה ואינו מותאם לעבוד עם תדרי דגימה אחרים.

איך מריצים

המודל שוקל 386 מגה-בייט בלבד ורץ דרך ספריית transformers הרגילה, כך שאין צורך בחומרת שרתים כבדה כדי להריץ אותו. כל מעבד מודרני או כרטיס מסך בסיסי יספיקו בהחלט להרצה מקומית או בתוך קונטיינר קטן בפרודקשן.

חובה להקפיד על קלט אודיו שנדגם בדיוק בקצב של 16kHz, אחרת הייצוגים שיופקו יהיו חסרי ערך. בגודל כזה ובמהירות ריצה כזו אין שום סיבה אמיתית לפנות לשירות ענן חיצוני, פשוט מריצים אותו מקומית וחוסכים תשלום לפי קריאה.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/wavlm-base-plus-sv")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 386 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בדף המודל לא דווח רישיון מוגדר, אך מופיע קישור למאגר הגיטהאב של UniSpeech. היעדר רישיון מוצהר וברור במטאדאטה מחייב לבדוק ידנית את הרישיון בקישור המקורי לפני שמשלבים אותו בפרויקט מסחרי, כדי לא להסתכן בהפרת זכויות שימוש.

הרישיון המלא בעמוד המודל ↗