GPT
W

wav2vec2-large-xlsr-53-chinese-zh-cn

קוד פתוח

jonatasgrosmanרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • jax
  • wav2vec2
  • automatic-speech-recognition

התאמה של מודל XLSR לתמלול סינית מנדרינית מקבצי אודיו. הפתרון פונה למי שמחפש לפענח דיבור ישירות בעזרת פייתון ובלי מודל שפה חיצוני.

  • 2.4 GBמשקל הקבצים
  • 1,382,680הורדות בחודש
  • 135לייקים
  • 24שכבות

מה זה

הפרויקט מתבסס על המודל הרב-לשוני של פייסבוק ועבר אימון ייעודי על נתוני דיבור בסינית מתוך Common Voice 6.1, CSS10 ו־ST-CMDS. הוא ממיר קול ישירות לתווים סיניים בארכיטקטורת CTC עם עשרים וארבע שכבות.

בבדיקות מול סט המבחן של Common Voice, המודל הציג שיעור שגיאות תווים של 19.03% ושיעור שגיאות מילים של 82.37%. בסינית אין רווחים בין מילים, ולכן מדד שגיאות המילים הרגיל מזנק לשמיים, אבל שיעור שגיאות התווים מעיד על דיוק סביר יחסית למודל שרץ ללא מודל שפה שמסדר את ההקשר התחבירי. הוא עוקף במעט גרסה מקבילה שנבדקה באותו עמוד.

מתאים ל

  • תמלול שיעורים והקלטות

    פיענוח אודיו נקי בסינית מנדרינית שנדגם ב־16kHz ומכיל משפטים קצרים וברורים.

  • חילוץ טקסט ראשוני

    בניית טיוטות טקסט מהירות מקול לפני העברה למערכת תיקון שגיאות או מודל שפה חיצוני.

  • אינדוקס קבצי קול

    המרת קטעי דיבור בסינית לתווים כדי לאפשר חיפוש טקסטואלי במאגרי הקלטות.

איפה זה נופל

הנקודה הקריטית ביותר היא דגימת הקול: המודל דורש בדיוק 16kHz, וכל קובץ אחר יחייב המרה מוקדמת כדי לא לקבל ג'יבריש. בנוסף, המודל רץ בלי מודל שפה, ולכן קשה לו מאוד להבדיל בין מילים שנשמעות זהה אך נכתבות בתווים שונים. הדוגמאות בעמוד מראות בבירור החלפה של סימניות דומות צליל, טעויות בתעתיק שמות זרים, והופעה של תגיות unk במילים לא מוכרות.

שאלות
נפוצות

האם המודל יודע לתמלל עברית או אנגלית?

לא. למרות שבסיס המודל המקורי תמך בשפות רבות, האימון הספציפי הזה יועד לסינית מנדרינית בלבד. הוא יוציא סימניות סיניות ולא יזהה מילים בעברית.

למה שיעור שגיאות המילים כל כך גבוה?

בסינית אין רווחים טבעיים בין מילים, ומדד WER בודק התאמה לפי רווחים. המדד החשוב באמת במודל הזה הוא שיעור שגיאות התווים, שעומד על 19.03%.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.4 גיגה-בייט, כך שהוא ירוץ בלי בעיה על מעבד גרפי סטנדרטי עם ארבעה עד שמונה גיגה זיכרון, ואפשר לדחוף אותו גם על מעבד רגיל אם זמן התגובה פחות קריטי לכם. מריצים אותו ישירות דרך ספריית transformers או בעזרת ספריית HuggingSound בכמה שורות פייתון.

אם יש לכם שרת עצמאי והקלט שלכם מגיע בסינית פשוטה, שווה להריץ אותו מקומית. אם אתם צריכים לפענח שעות רבות של שיחה בזמן אמת ואין לכם שרת זמין, החזקה של חומרה ייעודית רק בשבילו תהיה יקרה יותר מפנייה לשירותי ענן חיצוניים שמציעים תמלול מוכן.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="jonatasgrosman/wav2vec2-large-xlsr-53-chinese-zh-cn")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 2.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בעמוד המודל לא דווח רישיון בכלל. במצב כזה אין אישור מפורש לשימוש מסחרי, וזה יוצר סיכון משפטי למי שרוצה לשלב אותו במוצר מסחרי בלי לבדוק תחילה את תנאי השימוש של מאגרי האימון המקוריים.

הרישיון המלא בעמוד המודל ↗