GPT
W

wav2vec2-xlsr-53-espeak-cv-ft

קוד פתוח

facebookapache-2.02022-03-02

  • transformers
  • pytorch
  • wav2vec2
  • automatic-speech-recognition
  • speech

המודל ממיר דיבור מוקלט ישירות לפונמות פונטיות במגוון שפות במקום לטקסט רגיל. הוא מיועד למי שבונה זיהוי דיבור לשפות בלי דאטה או צריך ניתוח הגייה מדויק.

  • 1.2 GBמשקל הקבצים
  • 385,238הורדות בחודש
  • 52לייקים
  • 24שכבות

מה זה

מדובר בגרסה מכווננת של מודל XLSR-53 של פייסבוק, שעברה אימון על מאגר Common Voice כדי לזהות רצפי פונמות לפי תקן espeak. הוא לא מנסה לנחש מילים או לתקן שגיאות כתיב עם מודל שפה, אלא מתפקד כמודל אקוסטי טהור שמוציא את צלילי הדיבור שנשמעו בפועל.

בניגוד למודלי תמלול רגילים שפולטים ישירות משפטים קריאים, הפלט כאן הוא מחרוזת של תוויות פונטיות. מי שרוצה להגיע לטקסט כתוב חייב להשתמש במילון שממפה את הפונמות חזרה למילים, מה שנותן שליטה מלאה בפיענוח אבל דורש צעד עיבוד נוסף בצינור הפיתוח.

מתאים ל

  • זיהוי דיבור לשפות דלות מידע

    זיהוי פונמות בשפות שאין עבורן מספיק טקסט מתויג לבניית מודל תמלול שלם.

  • ניתוח הגייה בלימוד שפות

    השוואת הפונמות שמשתמש ביטא בפועל מול ההגייה הנכונה של המילה.

  • מודל אקוסטי בצינורות תמלול

    שילוב המודל כרכיב אקוסטי ראשוני שמזין מפענח מבוסס שפה או מילון ייעודי.

איפה זה נופל

הוא לא פולט מילים. אם תזינו אודיו תקבלו רצף פונטי גולמי, ותצטרכו לבנות או להחזיק מילון חיצוני שממפה את הצלילים האלה למילים אמיתיות כדי לקבל תמלול שבן אדם יכול לקרוא. בנוסף, חובה להמיר כל שמע ל־16kHz מראש, אחרת הפלט פשוט נהרס לחלוטין.

שאלות
נפוצות

אפשר להשתמש בו ישירות לתמלול של שיחות לעברית?

לא באופן ישיר. המודל מוציא פונמות באנגלית וסימנים פונטיים לפי espeak, ולא אותיות בעברית, ולכן צריך לבנות שכבת תרגום מפונמות למילים בעברית.

האם המודל דורש חיבור קבוע לענן?

לא. מורידים את 1.2 הגיגה בייט של הקבצים למחשב או לשרת מקומי ומריצים אותו אופליין לחלוטין עם transformers.

איך מריצים

טוענים את המודל ישירות דרך ספריית transformers בפייתון כמודל מסוג Wav2Vec2ForCTC. המשקל הכולל של הקבצים עומד על 1.2 גיגה בייט בפורמט float32, כך שכל כרטיס מסך בסיסי או מעבד מודרני מריצים אותו בלי בעיה מקומית וללא צורך בחומרה כבדה.

חובה לוודא שקובץ הקול נדגם בדיוק בקצב של 16kHz לפני ההזנה לרשת. בגלל שמדובר במודל אקוסטי שמוציא פונמות ולא טקסט שלם, אין טעם לפנות לשירותי API מסחריים כלליים כשצריכים דווקא את המידע הפונטי הזה.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="facebook/wav2vec2-xlsr-53-espeak-cv-ft")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗