GPT
W

wav2vec2-large-xlsr-53-russian

קוד פתוח

jonatasgrosmanapache-2.02022-03-02

  • transformers
  • pytorch
  • jax
  • wav2vec2
  • automatic-speech-recognition

המודל מציע תמלול קול לטקסט ברוסית למי שמחפש פתרון קוד פתוח מוכח. הוא מתאים במיוחד להרצה עצמאית בלי תלות בשירותי ענן חיצוניים.

  • 3.8 GBמשקל הקבצים
  • 3,816,363הורדות בחודש
  • 76לייקים
  • 24שכבות

מה זה

מדובר בהתאמה של ארכיטקטורת XLSR-53 הגדולה של פייסבוק לזיהוי דיבור ברוסית. המודל אומן על בסיסי הנתונים של Common Voice 6.1 ושל CSS10, ומשתמש בשיטת CTC כדי להמיר אודיו ישירות לאותיות קיריליות ללא צורך במודל שפה נפרד כברירת מחדל.

התוצאות בדוגמאות המצורפות מראות שהוא מתמודד מצוין עם משפטים ברורים ורשמיים, אבל גם חושפות את האופי שלו. כשנתקלים במילים ספרותיות קשות, שמות זרים או מבנה תחבירי מורכב, הוא נוטה לנחש פונטית. המילה תשע ברוסית הפכה אצלו למילה שגויה לחלוטין, ומשפטים ספרותיים קיבלו עיוותים קשים שמעידים על היעדר הבנה הקשרית עמוקה מעבר לרצף הצלילים.

מתאים ל

  • תמלול הקלטות ופודקאסטים

    המרת שמע ארוך ומובחן ברוסית לטקסט לצורכי חיפוש וארכוב.

  • מערכות ללא חיבור רשת

    פתרון טוב לסביבות סגורות ומאובטחות שחייבות תמלול מקומי ללא שליחת מידע החוצה.

  • בסיס לאימון נוסף

    נקודת מוצא להתאמה על מאגר קולי ייעודי של מוקדי שירות או דיאלקטים ספציפיים.

איפה זה נופל

המודל פולט אותיות רישיות בלבד וללא סימני פיסוק, מה שאומר שתצטרכו לנקות ולעבד את הפלט בעצמכם. הוא מתקשה מאוד עם שמות עצם פרטיים, מילים נדירות וקטעי דיבור רועשים, ומייצר תעתיק פונטי שגוי. הוא לא מגיע עם מודל שפה מובנה, ולכן שגיאות הגייה או רעשי רקע מייצרים מילים לא קיימות במקום לתקן לפי ההקשר הלשוני.

שאלות
נפוצות

האם הוא יודע לטפל בקבצי אודיו של שיחות טלפון?

רק אם תמירו אותם מראש ל־16 קילוהרץ. איכות השיחה הטלפונית עלולה להוריד את הדיוק משמעותית, כיוון שהמודל רגיש לצלילים עמומים ולשגיאות פונטיות.

האם הפלט כולל סימני פיסוק וחלוקה למשפטים?

לא. המודל מחזיר שרשרת מילים באותיות גדולות ללא נקודות, פסיקים או אותיות קטנות, ותצטרכו מודל שפה משני כדי להפוך את הטקסט לקריא.

איך מריצים

כדי להריץ אותו אפשר להשתמש בספריית HuggingSound שמופיעה בתיעוד או ישירות דרך transformers של פייתון. הוא שוקל 3.8 גיגה בייט, כך שכרטיס מסך מודרני עם שמונה גיגה זיכרון יחזיק אותו בקלות לאינפרנס, ואפשר לדחוף אותו גם למעבד רגיל אם זמן התגובה פחות קריטי.

חובה להמיר את כל קבצי הקול לקצב דגימה של 16 קילוהרץ לפני ששולחים אותם לעיבוד. אם אתם בונים מערכת בזמן אמת עם עשרות אלפי בקשות במקביל ואין לכם שרתים מתאימים, כנראה שעדיף לשלם לפי דקה ב־API חיצוני.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="jonatasgrosman/wav2vec2-large-xlsr-53-russian")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי קוד והפצה סגורה. התנאי היחיד הוא שמירה על זכויות היוצרים של היוצר והצהרת השינויים שביצעתם בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗