GPT
W

wav2vec2-large-xlsr-53-english

קוד פתוח

jonatasgrosmanapache-2.02022-03-02

  • transformers
  • pytorch
  • jax
  • safetensors
  • wav2vec2

התאמה של מודל רב לשוני לתמלול אנגלית בלבד על בסיס דאטהסט שיתופי. מתאים למי שרוצה להריץ זיהוי דיבור מקומי בארכיטקטורת CTC בלי תלות במודל שפה חיצוני.

  • 315Mפרמטרים
  • 4.3 GBמשקל הקבצים
  • 54,731הורדות בחודש
  • 477לייקים

מה זה

המודל הזה לוקח את הבסיס הרב לשוני של פייסבוק ומכוון אותו ספציפית לאנגלית בעזרת נתוני האימון של Common Voice 6.1. הוא מסתמך על ארכיטקטורת Wav2Vec2ForCTC עם 24 שכבות, מה שאומר שהוא מתרגם גלי קול ישירות לתווים בלי לעבור דרך מודל שפה שמנחש את ההקשר של המשפט.

בפועל, כפי שרואים בדוגמאות ההשוואה הישירות, זה אומר שהוא מתמלל פונטית בצורה מדויקת יחסית במשפטים פשוטים, אבל מתקשה ברגע שיש מילים נדירות, שמות של חברות או ביטויים סלנגיים. כשהוא נתקל במילים מורכבות, הפלט הופך לרצף אותיות שנשמע דומה למקור אך חסר משמעות תחבירית אמיתית.

מתאים ל

  • תמלול קולי פנימי ללא ענן

    מאפשר תמלול פקודות אודיו באנגלית ישירות על החומרה המקומית כדי לשמור על פרטיות מלאה של המידע.

  • אינדוקס קבצי אודיו באנגלית

    מתאים להמרת הקלטות ברורות לטקסט לצורך חיפוש מילים מרכזיות במאגרי מידע מקומיים.

  • עיבוד פקודות קצרות וברורות

    עובד טוב על משפטים מובנים וקצרים שבהם אין סלנג מורכב או מילים נדירות.

איפה זה נופל

הבעיה המרכזית שלו היא היעדר מודל שפה צמוד. הדוגמאות מציגות בבירור כשלים בהבנת הקשר, כמו כתיבת Q and Q במקום queue and cue, או תמלול עיוור של מילים לא מוכרות כמו הפיכת מוזילה למוסלילאר. הוא אומן על אנגלית בלבד ולכן אינו מזהה עברית, והוא דורש שהאודיו שלכם יומר ידנית ל־16kHz. אם יש לכם רעשי רקע כבדים או מונחים מקצועיים, הוא יזרוק שגיאות איות פונטיות.

שאלות
נפוצות

האם המודל יודע לתמלל הקלטות בעברית?

לא. למרות שהבסיס המקורי הוא רב לשוני, הגרסה הזו עברה כוונון ייעודי לאנגלית בלבד על גבי Common Voice. הזנת אודיו בעברית תניב בליל אותיות באנגלית או פלט ריק.

מה קורה אם קובץ הקול שלי הוא לא ב־16kHz?

המודל לא יעבוד כמו שצריך. הכרטיס מציין במפורש שחובה להמיר את קובץ השמע מראש לקצב דגימה של 16kHz לפני שמעבירים אותו לתמלול, אחרת התוצאות יהיו משובשות לחלוטין.

למה התמלול של שמות ומילים טכניות יוצא משובש?

המודל משתמש בחיזוי תווים ישיר על בסיס צליל ללא מודל שפה שמתקן שגיאות לפי היגיון. מילים כמו שמות מותגים או ביטויים עם כפל משמעות ייכתבו לפי איך שהן נשמעות ולא לפי הכתיב הנכון.

איך מריצים

המודל מגיע עם משקל של 4.3 גיגה בייט ומכיל 315 מיליון פרמטרים. בשביל אינפרנס סביר לא צריך מפלצת, אבל כן מומלץ כרטיס מסך מודרני עם לפחות שמונה גיגה זיכרון כדי לעבד קבצים בלי חנק, אם כי אפשר לדחוף אותו גם למעבד רגיל עבור קבצים קצרים ובודדים דרך ספריית HuggingSound או transformers ישירות.

תנאי סף קריטי להרצה הוא קצב דגימה של 16 קילו הרץ בדיוק בקלט האודיו, אחרת הפלט יהיה שגוי לחלוטין. אם המטרה היא לתמלל שיחות ארוכות או אודיו מלוכלך בקצב גבוה ובלי להתעסק בהמרות קבצים מראש, עדיף להשתמש בפתרון ענן מנוהל.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="jonatasgrosman/wav2vec2-large-xlsr-53-english")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0, שמאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי מלא, שינוי הקוד והפצה פנימית או מסחרית בתוך מוצר. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗