GPT
W

wavlm-base-plus

קוד פתוח

microsoftרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • wavlm
  • feature-extraction
  • speech

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

בסיס חזק לעיבוד קול באנגלית שאומן על 94 אלף שעות הקלטה. לוקחים אותו כשרוצים לחלץ ייצוגים עמוקים לזיהוי דוברים או סיווג שמע ולא רק לתמלל מילים.

  • 360 MBמשקל הקבצים
  • 954,745הורדות בחודש
  • 40לייקים
  • 12שכבות

מה זה

מייקרוסופט אימנו את המודל הזה על בסיס ארכיטקטורת HuBERT עם 12 שכבות, במטרה לשמר גם את תוכן הדיבור וגם את זהות הדובר. במקום להסתפק בהקלטות נקיות, הם ערבבו קטעי קול שונים בזמן האימון כדי להכריח אותו להבדיל בין דוברים גם כשיש רעש או חפיפה. סך הכול נכנסו פה 60 אלף שעות מתוך Libri-Light, עוד 10 אלפים מתוך GigaSpeech ו־24 אלף מתוך VoxPopuli.

התוצאה היא חילוץ וקטורים שמחזיק מעמד במבחני SUPERB במגוון משימות שמע, מזיהוי רגש ועד הפרדת דוברים. הוא מגיע בקובץ של 360 מגה בייט בפורמט float32, שזה משקל נוצה בהשוואה למודלי שפה, אבל אסור לשכוח שמדובר ברכיב שמייצר ייצוגים מספריים בלבד ולא פולט טקסט ישירות מהקופסה.

מתאים ל

  • חילוץ וקטורים לזיהוי דובר

    הוא אומן במיוחד על קולות חופפים, ולכן מייצר ייצוגים שמפרידים היטב בין אנשים שונים.

  • בסיס למערכת תמלול באנגלית

    הוא למד מ־94 אלף שעות שמע ומספק נקודת זינוק מצוינת לכוונון עם ראש תמלול.

  • סיווג אודיו וזיהוי רגש

    הייצוגים שלו כוללים מידע פראלינגוויסטי עשיר שמשקף נימת דיבור ומצב רגשי.

איפה זה נופל

המודל אומן רק על אנגלית, ואין פה שום הבטחה או בדיקה לגבי שפות אחרות, בטח לא עברית. הוא לא כולל טוקנייזר ולכן אי אפשר לזרוק עליו הקלטה ולקבל טקסט בלי לבנות תהליך אימון נוסף. מעבר לזה, האימון מבוסס על פונמות ולא על תווים, מה שמחייב המרה מוקדמת של טקסט האימון לרצף פונמות אם המטרה היא זיהוי דיבור. אם חיפשתם פתרון שעובד מהשנייה הראשונה, תתאכזבו.

שאלות
נפוצות

אפשר להעלות אליו קובץ ולקבל תמלול מיד?

לא. המודל מוגדר לחילוץ מאפיינים בלבד ואין לו שכבת פענוח לטקסט או טוקנייזר. כדי לקבל תמלול צריך לבנות מעליו ראש מתאים ולאמן אותו על טקסט שמומר לפונמות.

הוא מתאים לקבצי שמע שהוקלטו בטלפון?

הוא מקבל אך ורק שמע שנדגם ב־16kHz. הקלטות טלפוניות רגילות מגיעות לרוב ב־8kHz, ולכן תצטרכו לדגום אותן מחדש לפני ההזנה, מה שעלול לפגוע באיכות הייצוגים.

איך מריצים

במשקל של 360 מגה בייט ו־12 שכבות, אפשר להריץ אותו בקלות על מעבד רגיל, ובטח על כל כרטיס מסך פשוט מהשנים האחרונות דרך ספריית transformers. הוא לא דורש שרתים מנופחים, ואין שום סיבה לשלם ל־API חיצוני כדי לחלץ ממנו מאפיינים אם יש לכם שרת ייעודי בסיסי.

חובה להזין לו קבצי שמע שנדגמו בדיוק בקצב של 16kHz, אחרת הווקטורים שתקבלו יהיו חסרי משמעות. כדי להגיע איתו למוצר עובד שמתמלל או מסווג, תצטרכו להוסיף מעליו שכבת פלט ולאמן אותה על המידע שלכם.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="microsoft/wavlm-base-plus")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 360 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בעמוד המודל הרשמי לא סומן רישיון מוגדר, אף שכרטיס המודל מפנה לקישור חיצוני בגיטהאב של UniSpeech. היעדר הגדרה ברורה בהאגינג פייס אומר שאי אפשר לקבוע בוודאות אם השימוש המסחרי מותר בלי לבדוק ישירות את הרישיון במאגר המקורי.

הרישיון המלא בעמוד המודל ↗