GPT
W

wav2vec2-large-xlsr-53-japanese

קוד פתוח

jonatasgrosmanapache-2.02022-03-02

  • transformers
  • pytorch
  • jax
  • wav2vec2
  • automatic-speech-recognition

פתרון מוכן לתמלול אודיו ביפנית שרץ מקומית בלי תלות ברשת. הוא עבר כוונון ייעודי על כמה מאגרי דיבור פתוחים ומתאים לעיבוד ישיר של קול לטקסט.

  • 2.4 GBמשקל הקבצים
  • 13,801,293הורדות בחודש
  • 65לייקים
  • 24שכבות

מה זה

מדובר בהתאמה של ארכיטקטורת XLSR בת 24 שכבות עבור השפה היפנית, שנבנתה על בסיס נתוני Common Voice 6.1, JSUT ו־CSS10. הוא מתבסס על מנגנון CTC כדי להמיר אותות שמע ישירות לתווים, בלי להיעזר במודל שפה חיצוני בזמן הפענוח הבסיסי.

במבחני הביצועים על מערך הבדיקה של Common Voice, הוא מציג שיעור שגיאת תווים של 20.16 אחוזים ושיעור שגיאת מילים של 81.80 אחוזים. המספר הגבוה במילים נובע בעיקר מהאופן שבו יפנית נכתבת ללא רווחים, מה שמקשה על מדידת מילים מסורתית, ולכן המדד האמיתי שקובע כאן הוא שגיאת התווים, שבה הוא עוקף חלופות מקבילות שנבדקו מולו באותה תקופה.

מתאים ל

  • תמלול ראשוני לארכיונים

    הפקת טיוטות טקסט מהקלטות יפניות בתדר 16kHz לחיפוש מהיר, לפני בדיקה ועריכה של גורם אנושי.

  • זיהוי פקודות קוליות קצרות

    קליטת ביטויים ברורים וקצרים שבהם מילים פשוטות יחסית מזוהות בלי צורך בניתוח תחבירי מורכב.

  • בסיס למערכת עם שפה מותאמת

    שימוש כשכבת שמע ראשונה שמחברים אליה מודל שפה חיצוני ביפנית לתיקון שגיאות כתיב וקאנג'י.

איפה זה נופל

החולשה העיקרית שלו נעוצה בדיוק בפועל: שגיאת תווים של כעשרים אחוז אומרת שכל תו חמישי עלול להיות שגוי. הדוגמאות מראות שהוא נוטה להחליף קאנג'י בקאנג'י אחר שנשמע דומה, לפספס מילים בלועזית ולהחזיר לעיתים טוקנים לא מזוהים. בלי לחבר אליו מודל שפה חיצוני שיתקן את ההקשר התחבירי, התמליל הגולמי לא מספיק נקי כדי להציג אותו למשתמשי קצה כפי שהוא.

שאלות
נפוצות

האם חייבים להמיר את קובץ הקול לפני השליחה?

כן. התשתית דורשת קלט שנדגם בדיוק בקצב של 16kHz. אם תשלחו קבצים בקצב דגימה אחר, התמלול יתקבל כרעש או ייכשל לחלוטין.

האם התוצר של המודל כולל סימני פיסוק?

לפי דוגמאות ההרצה, הפלט לעיתים חסר פיסוק או מציג תווים לא מזוהים במקום שמות זרים ומושגים נדירים. לכן כדאי לתכנן שכבת ניקוי נוספת לפלט.

איך מריצים

המודל שוקל 2.4 גיגה-בייט ומיועד לעבודה עם ספריית transformers או דרך huggingsound בקוד פייתון פשוט. כדי לקבל תוצאות מדויקות, חובה לדגום את כל קובצי השמע הנכנסים בתדר של 16kHz לפני שמעבירים אותם לפענוח.

מבחינת חומרה, אפשר להריץ אותו על מעבד מרכזי סביר עבור קבצים בודדים, אבל אם יש לכם נפח עבודה רציף או קבצים ארוכים, כרטיס מסך עם זיכרון ייעודי יקצר את זמני ההמתנה. להרצה מקומית יש יתרון כשרוצים לשמור על פרטיות ההקלטות ולא לשלם לספקי ענן חיצוניים על כל דקת שמע.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="jonatasgrosman/wav2vec2-large-xlsr-53-japanese")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 2.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי, כולל שילוב במוצרים מסחריים והתאמה של הקוד. התנאי המרכזי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗