GPT
W

wav2vec2-large-xlsr-53-portuguese

קוד פתוח

jonatasgrosmanapache-2.02022-03-02

  • transformers
  • pytorch
  • jax
  • wav2vec2
  • automatic-speech-recognition

המודל מתמלל דיבור בפורטוגזית ישירות מקובצי אודיו, בלי תלות במודל שפה נוסף. הוא מתאים למי שצריך תמלול מקומי בפורטוגזית ולא רוצה לשלם על שירותי ענן חיצוניים.

  • 3.5 GBמשקל הקבצים
  • 5,144,479הורדות בחודש
  • 55לייקים
  • 24שכבות

מה זה

מדובר בהתאמה של המודל הגדול XLSR-53 של פייסבוק לזיהוי דיבור בפורטוגזית, אחרי אימון על Common Voice 6.1. עם 24 שכבות ומשקל קבצים של 3.5 גיגה בייט, הוא רץ על ארכיטקטורת Wav2Vec2ForCTC ומבצע את התמלול ישירות מגל הקול לטקסט.

דוגמאות התוצאה שהוצגו בכרטיס ממחישות היטב את המציאות: משפטים פשוטים וקצרים עוברים בדיוק מושלם, אבל ברגע שיש מילים זרות, הקשר מורכב או שמות לא שגרתיים, המודל מייצר שגיאות פונטיות צורמות. הוא מנסה לנחש איך נשמעת המילה לפי אותיות, מה שגורם להזיות איות כשמדובר באוצר מילים מחוץ לקו הבסיס.

מתאים ל

  • תמלול הקלטות בפורטוגזית

    הוא מיועד לחילוץ טקסט מהיר משיחות מוקלטות או קובצי קול בשפה זו.

  • עיבוד מקומי של שיחות

    מתאים למי שלא מוכן להוציא קובצי אודיו אל מחוץ לרשת המקומית בגלל פרטיות.

  • כתוביות לסרטונים

    יכול לייצר טיוטת תמלול לקטעי וידאו שמדברים בהם בפורטוגזית ברורה.

איפה זה נופל

הנקודה הכי חלשה היא היעדר מודל שפה מובנה לתיקון שגיאות הקשר. בדוגמאות הרשמיות רואים שהוא שובר מילים מורכבות, מתקשה עם ביטויים לועזיים כמו המילה stealth, ומחליף מילים שלמות באחרות שנשמעות דומה. בנוסף הוא דורש הכנה מוקדמת של האודיו לקצב של 16 קילוהרץ ולא יתמודד לבד עם קבצים בקצב אחר.

שאלות
נפוצות

האם המודל תומך בתמלול של שפות אחרות כמו עברית?

לא. ההתאמה הספציפית הזו אומנה אך ורק על פורטוגזית, וכל ניסיון לתמלל שפה אחרת יפיק רצף חסר פשר של אותיות.

מה חובה לעשות לפני ששולחים קובץ אודיו למודל?

חייבים להמיר את קובץ הקול לקצב דגימה של 16kHz בדיוק, כי המודל לא מתמודד עם קצבים אחרים.

איך מריצים

טוענים אותו בספריית transformers הרגילה או בעזרת HuggingSound עם שורות קוד בודדות בפייתון ומעבירים לו נתיב לקובץ קול. חובה לוודא שקובץ האודיו מומר לקצב דגימה של 16 קילוהרץ לפני השליחה, אחרת הפלט יהיה שגוי לגמרי.

בשביל להריץ אותו מקומית בקצב סביר צריך כרטיס מסך עם לפחות שמונה גיגה בייט זיכרון, במיוחד אם מעבדים קבצים ארוכים או כמה קבצים במקביל. אם יש לכם שרת ייעודי ופרטיות המידע קריטית זה עובד יפה, אבל אם מדובר בכמויות אודיו מזעריות פעם בחודש, החזקת שרת כזה תעלה יותר מסתם שימוש ב־API מסחרי.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="jonatasgrosman/wav2vec2-large-xlsr-53-portuguese")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי לחלוטין. אפשר להטמיע את המשקלים בתוך מוצר, לשנות את הקוד ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗