GPT
W

wavlm-large

קוד פתוח

microsoftרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • wavlm
  • feature-extraction
  • speech

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

בסיס עיבוד אודיו שיודע לחלץ ייצוגים עמוקים מדיבור באנגלית. הוא נבנה כדי לתפוס גם את תוכן המילים וגם את זהות הדובר מתוך 94,000 שעות הקלטה.

  • 1.2 GBמשקל הקבצים
  • 1,136,826הורדות בחודש
  • 114לייקים
  • 24שכבות

מה זה

מייקרוסופט אימנו את המודל הזה על בסיס HuBERT, תוך שימוש בערבוב קטעי דיבור חופפים כדי לאלץ אותו להבדיל בין דוברים שונים, לצד הוספת מנגנון הטיה למיקום יחסי ברשת. המטרה היתה לתת מענה לכל שרשרת משימות האודיו, כולל זיהוי דוברים וסיווג קול, ולא רק תמלול טקסט רגיל.

האימון נעשה על 94 אלף שעות של דיבור באנגלית מתוך שלושה מאגרים: Libri-Light, GigaSpeech ו־VoxPopuli. המודל עצמו כולל 24 שכבות ומגיע במקור לחילוץ מאפיינים, כך שהוא לא מייצר טקסט ישירות אלא מוציא וקטורים שמייצגים את האודיו עבור מודלים אחרים שתאמנו מעליו.

מתאים ל

  • זיהוי דוברים באנגלית

    חילוץ וקטורים שמבדילים בין קולות שונים, בזכות אימון שכלל קטעי דיבור חופפים.

  • בסיס למודל תמלול מותאם

    אימון שכבת תמלול ייעודית באנגלית מעל ייצוגי פונמות עמוקים שנלמדו מ־94 אלף שעות.

  • סיווג רגשות ומאפייני קול

    שימוש בייצוגי האודיו של 24 השכבות לזיהוי מאפיינים פאראלינגוויסטיים בדיבור.

איפה זה נופל

הוא לא מוציא תמלול ישירות מהקופסה. אין לו טוקנייזר מובנה, והוא אומן על פונמות ולא על תווים, כך שכדי להוציא ממנו טקסט תצטרכו לבנות טוקנייזר, להמיר את הטקסט לרצף פונמות ולאמן אותו בעצמכם על דאטה מתויג. מעבר לזה, הוא אומן אך ורק על דיבור באנגלית, כך שהוא לא מתאים לעברית או לשפות אחרות.

שאלות
נפוצות

האם אפשר להשתמש בו כדי לתמלל שיחה בעברית?

לא. המודל אומן כולו על מאגרי דיבור באנגלית בלבד, ולא נחשף לעברית במהלך האימון. שימוש בו על אודיו בעברית לא ייתן ייצוגים יעילים.

למה אני לא מקבל טקסט כשאני מריץ עליו קובץ שמע?

הוא מוגדר למשימת חילוץ מאפיינים ולא כולל שכבת פלט של תווים או מילים. כדי לקבל טקסט צריך לחבר אליו ראש מתאים, להשתמש בטוקנייזר פונמות ולאמן אותו על נתונים מתויגים.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.2 גיגה בייט בדיוק של float32, כך שלא תצטרכו חומרת שרתים מפלצתית כדי להעלות אותו לזיכרון. כרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון יספיק לטעינה ולהרצה שוטפת בספריית transformers.

הוא דורש שהאודיו שמוזן אליו יידגם בדיוק בקצב של 16kHz. אם יש לכם צורך רק בתמלול סטנדרטי בלי אימון מורכב של שכבות נוספות, כנראה שעדיף לפנות לשירותי ענן מוכנים או למודלים שכבר כוללים ראש תמלול מאומן, במקום להרים אותו מאפס.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="microsoft/wavlm-large")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בדף המודל לא מוגדר רישיון רשמי ומופיע קישור חיצוני בלבד. במצב כזה, שימוש בפרויקט מסחרי מסוכן מאוד עד שלא בודקים את תנאי הרישיון במאגר המקורי של מייקרוסופט ומוודאים שאין עליו הגבלות מחקר בלבד.

הרישיון המלא בעמוד המודל ↗