GPT
W

wav2vec2-large-960h-lv60-self

קוד פתוח

facebookapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • wav2vec2

זה מודל זיהוי דיבור מבוסס CTC שתמלל 960 שעות של אודיו באנגלית. הוא נותן דיוק גבוה מאוד על הקלטות נקיות בלי צורך בתשתית ענקית.

  • 3.5 GBמשקל הקבצים
  • 101,642הורדות בחודש
  • 163לייקים
  • 24שכבות

מה זה

מדובר במודל מבוסס 24 שכבות של פייסבוק שממיר אודיו גולמי לטקסט באנגלית. הוא עבר אימון מקדים וכוונון על 960 שעות ממאגרי LibriSpeech ו־Libri-Light בשיטת אימון עצמי. הרעיון כאן פשוט, המודל לומד ייצוגים מתוך האודיו עצמו על ידי מיסוך אותות, ולאחר מכן משתמש בראש CTC כדי להוציא תווים ישירות מהאות.

במבחני הביצועים הוא מגיע לציון של 1.9 אחוזי שגיאת מילים על סט הבדיקה הנקי ו־3.9 על הסט המאתגר יותר. המספרים האלה מראים שהוא מתמודד מצוין עם אנגלית ברורה, אבל ברגע שיש רעשי רקע, מבטאים כבדים או איכות שמע ירודה, שיעור הטעויות עולה ביותר מפי שניים. הוא לא מייצר משפטים מתוך מודל שפה אלא מפענח ישירות את גלי הקול.

מתאים ל

  • תמלול הקלטות באנגלית

    מתאים לתמלול פודקאסטים או שיחות מוקלטות באנגלית נקייה בקצב דגימה מתאים.

  • זיהוי פקודות קוליות

    פועל ישירות מול מערכי שמע ומחזיר טקסט מהר על גבי מעבד גרפי סטנדרטי.

  • בסיס לכוונון נוסף

    אפשר לקחת את 24 השכבות המאומנות ולאמן את הראש לתחום צר או מבטא מסוים.

איפה זה נופל

הוא יודע אנגלית בלבד ולא מבין מילה בעברית. המודל דורש בדיוק 16 קילוהרץ, וכל סטייה בקצב הדגימה תהרוס את התוצאה. מעבר לזה, אין לו מודל שפה פנימי שמתקן שגיאות הקשר, כך שאם יש רעש חזק או בליעת מילים, הוא פשוט יפלוט רצף אותיות שגוי.

שאלות
נפוצות

האם אפשר להשתמש בו לשיחות בעברית?

לא. הוא אומן אך ורק על מאגרי שמע באנגלית. בשביל עברית תצטרכו לחפש מודל שאומן על השפה או לבצע כוונון מחדש לגמרי.

מה יקרה אם אעביר קובץ באיכות 44.1 קילוהרץ?

הוא ייצר טעויות תמלול קשות או רצף תווים לא קריא. חייבים להמיר את קובץ האודיו ל־16 קילוהרץ לפני שמעבירים אותו לפרוססור.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers באמצעות Wav2Vec2ForCTC ומעבירים אליו מערך שמע. חובה להמיר מראש את כל קובצי הקול לקצב דגימה של 16 קילוהרץ, אחרת הפלט יהיה חסר משמעות לחלוטין.

המשקל שלו הוא 3.5 גיגה בייט, כך שכרטיס מסך מודרני ממוצע מחזיק אותו בקלות בזיכרון ומבצע תמלול מהיר. אם אתם צריכים לתמלל כמויות קטנות פעם ב, להחזיק שרת ייעודי זה מיותר לגמרי ועדיף לשלוח ל־API חיצוני. אם יש לכם זרם קבוע של אודיו באנגלית וחשוב לכם שהמידע יישאר מקומית, הרצה עצמית כאן פשוטה ויעילה.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="facebook/wav2vec2-large-960h-lv60-self")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי הקוד והפצה פנימית או חיצונית במוצר שלכם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗