GPT
W

wav2vec2-large-xlsr-53-arabic

קוד פתוח

jonatasgrosmanapache-2.02022-03-02

  • transformers
  • pytorch
  • jax
  • wav2vec2
  • automatic-speech-recognition

זה מודל קוד פתוח לתמלול ערבית שנבנה על בסיס XLSR-53. הוא מציע פתרון עצמאי למי שחייב לעבד הקלטות בלי לשלוח שום מידע לענן חיצוני.

  • 2.4 GBמשקל הקבצים
  • 2,508,661הורדות בחודש
  • 55לייקים
  • 24שכבות

מה זה

המודל הזה הוא כוונון של פייסבוק XLSR-53 על נתוני Common Voice 6.1 וקורפוס Arabic Speech Corpus. הוא מיועד למשימה אחת בלבד, לקבל אודיו בערבית ולהחזיר טקסט כתוב. המבנה שלו מבוסס על 24 שכבות בארכיטקטורת Wav2Vec2ForCTC, שמאפשרת להריץ תמלול ישיר אפילו בלי להצמיד לו מודל שפה נפרד.

במבחן הרשמי על סט הבדיקה של Common Voice בערבית, הוא השיג שיעור שגיאות מילים של 39.59% ושיעור שגיאות תווים של 18.18%. המספרים האלה מראים שהוא הוביל בהשוואה למודלים מקבילים שנבדקו באותו תאריך, אבל טעות של כמעט ארבע מתוך עשר מילים אומרת שתקבלו לא מעט טעויות גסות במשפטים מורכבים.

מתאים ל

  • אינדוקס שיחות מוקלטות

    חילוץ מילות מפתח מתוך הקלטות בערבית לצורך חיפוש וסיווג, איפה שדיוק מושלם של כל אות פחות קריטי.

  • טיוטת תמלול ראשונית

    יצירת בסיס טקסטואלי ראשוני לקטעי קול לפני בדיקה ועריכה של מתמלל אנושי כדי לחסוך זמן הקלדה.

  • תמלול בשרת מאובטח

    מערכות שלא מורשות להוציא קול לרשת החיצונית וחייבות להריץ תמלול ערבית מקומי על גבי שרת מבודד.

איפה זה נופל

הבעיה המרכזית שלו היא רמת הדיוק. שגיאת מילים של 39.59% אומרת שבטקסטים עם מילים נדירות או חיבורי מילים מהירים, התוצאה תדרוש עריכה אנושית כבדה. הדוגמאות מראות שהוא מחבר מילים בטעות, כמו הדבקה של מילים במשפט, ומשמיט ניקוד או סימני שאלה. בנוסף, חובה להזין לו אודיו שנדגם בדיוק ב־16kHz, אחרת הוא פשוט מוציא פלט משובש לחלוטין.

שאלות
נפוצות

האם אפשר לשלוח למודל קובצי שמע בכל איכות?

לא. החומר מחייב להזין אודיו שנדגם בקצב של 16kHz בדיוק. אם הקבצים שלכם הוקלטו בקצב אחר, תצטרכו להמיר אותם לפני ההרצה.

האם חייבים מודל שפה חיצוני כדי לקבל טקסט קריא?

אפשר להריץ אותו ישירות בלי מודל שפה נוסף, והוא יחזיר תמלול. עם זאת, בלי מודל שפה שיעור השגיאות עומד על 39.59%, כך שייתכנו שגיאות כתיב וחיבורי מילים.

איך מריצים

כדי להריץ אותו צריך רק את ספריית transformers או את ספריית huggingsound של היוצר, שמריצה קובצי אודיו בכמה שורות פייתון בודדות. עם משקל של 2.4 GB המודל הזה דורש כרטיס מסך מודרני עם זיכרון סביר כדי לעבוד מהר, אם כי אפשר להריץ אותו על מעבד מרכזי בתמורה לזמני עיבוד ארוכים יותר.

אם אין לכם תשתית שרתים או אם אתם צריכים תמלול מזדמן בהיקף נמוך, הקמה של סביבה ייעודית תעלה לכם יותר זמן וכסף מחשבון API של ספק ענן. להריץ אותו לבד משתלם בעיקר כשיש דרישות פרטיות מחמירות או נפח קול מתמיד שלא מאפשר תשלום לפי דקה.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="jonatasgrosman/wav2vec2-large-xlsr-53-arabic")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 2.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי לחלוטין, שינוי הקוד והפצה פנימית או חיצונית. מותר לשלב אותו במוצר סגור בלי לחשוף קוד, כל עוד שומרים על הודעת זכויות היוצרים ועותק הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗