GPT
W

wav2vec2-base-960h

קוד פתוח

facebookרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • safetensors
  • wav2vec2

המודל הזה מתמלל דיבור באנגלית ישירות מקובצי אודיו, בלי רכיבי שפה נפרדים. הוא הבחירה הטבעית למי שמחפש פתרון קל משקל להרצה מקומית בלי תלויות מנופחות.

  • 1.1 GBמשקל הקבצים
  • 1,351,839הורדות בחודש
  • 403לייקים
  • 12שכבות

מה זה

מדובר במודל זיהוי דיבור של פייסבוק שמתבסס על 12 שכבות בארכיטקטורת CTC, ואומן מראש ולאחר מכן עבר כוונון עדין על 960 שעות של דיבור מוקלט ממאגר Librispeech. הוא מקבל גלי קול גולמיים ופולט טקסט ישירות, מה שהופך את תהליך התמלול למהיר יחסית בהשוואה למודלים שמסתמכים על מודלי שפה חיצוניים כבדים.

במבחני התוצאה הרשמיים על Librispeech הוא מציג שיעור שגיאות מילים של 3.4 בהקלטות נקיות, וקופץ ל־8.6 בהקלטות מורכבות יותר. הפער הזה מראה שבסביבה אקוסטית אידיאלית הוא מדייק מאוד, אבל ברגע שיש רעשי רקע, מבטאים מאתגרים או איכות שמע ירודה, הוא יפספס הרבה יותר מילים.

מתאים ל

  • תמלול הקלטות באנגלית

    הוא מגיע מכוונן על 960 שעות דיבור ונותן דיוק טוב על שמע באנגלית שנשמע נקי.

  • תמלול מקומי על חומרה צנועה

    במשקל של 1.1 גיגה בייט, אפשר להריץ אותו גם בלי להשקיע בשרתים יקרים או בכרטיסי מסך מיוחדים.

  • בסיס לכוונון בשפות אחרות

    12 השכבות שלו כבר מבינות ייצוגי קול גולמיים, וקל להמשיך לאמן אותו על דאטה ייעודי.

איפה זה נופל

הוא אומן על אנגלית בלבד. אם תזרקו עליו עברית תקבלו ג'יבריש. המודל גם דורש שמע של 16kHz בדיוק ולא סולח על סטיות. בנוסף, בגלל שהוא נשען על CTC בלי מודל שפה חזק שמתקן שגיאות הקשר, הוא רגיש מאוד לדיבור מהיר, ללחישות או להקלטות עם רעשי רקע, מה שמשתקף בבירור בקפיצה ל־8.6 שיעור שגיאות בהקלטות פחות נקיות.

שאלות
נפוצות

האם אפשר להשתמש בו כדי לתמלל שמע בעברית?

לא. המודל הספציפי הזה אומן וכונן אך ורק על מאגר Librispeech באנגלית. כדי לעבוד בעברית תצטרכו לאמן אותו מחדש על הקלטות מקומיות או לחפש גרסה שעברה כוונון ייעודי.

למה התוצאות יוצאות משובשות לגמרי בקבצים מסוימים?

הסיבה הנפוצה ביותר היא קצב דגימה לא מתאים. המודל מחייב בדיוק 16kHz, ואם תזינו שמע ב־44.1kHz בלי לבצע המרה מראש, הוא לא יזהה את המילים נכון.

איך מריצים

מריצים אותו ישירות מתוך ספריית transformers בפייתון דרך Wav2Vec2ForCTC יחד עם המעבד המתאים. קובצי המודל שוקלים 1.1 גיגה בייט בלבד, כך שלא חובה מעבד גרפי מפלצתי. הוא ירוץ בלי בעיה על כרטיס מסך פשוט או אפילו על מעבד מרכזי חזק אם מדובר בקבצים בודדים.

חובה להמיר מראש כל קובץ קול לקצב דגימה של 16 קילוהרץ לפני שמעבירים אותו למודל, אחרת הפלט יהיה שגוי לחלוטין. אם אתם מתכננים לעבד כמויות אדירות של אודיו בזמן אמת, אולי עדיף שירות ענן חיצוני, אבל למשימות אצווה מקומיות הגודל שלו נותן יתרון ענק בביצועים.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="facebook/wav2vec2-base-960h")
print(pipe("שלום"))

הרישיון

הרישיון לא דווח בעמוד המודל. במצב כזה, מבחינה משפטית אין אישור ברור לשימוש מסחרי, וזה יוצר סיכון אם אתם רוצים לשלב אותו במוצר שמייצר הכנסות. מי שמתכנן להוציא איתו מוצר לשוק יצטרך לבדוק את תנאי המאגר המקורי בפייסבוק לפני שמתחייבים עליו.

הרישיון המלא בעמוד המודל ↗