GPT
W

wav2vec2-large-robust

קוד פתוח

facebookapache-2.02022-03-02

  • transformers
  • pytorch
  • wav2vec2
  • pretraining
  • speech

זה מודל קול שפייסבוק אימנה על שיחות טלפון רועשות לצד ספרי שמע, במטרה להתמודד עם שמע מלוכלך. הוא בסיס מעולה לאימון המשך, אבל לא פולט טקסט מהקופסה.

  • 1.2 GBמשקל הקבצים
  • 1,687הורדות בחודש
  • 41לייקים
  • 24שכבות

מה זה

בניגוד לגרסאות רגילות של wav2vec 2.0 שהתאמנו בעיקר על קריאה נקייה של ספרי שמע, כאן הדחיפה העיקרית הייתה חסינות לרעש ולסביבות שונות. פייסבוק ערבבה באימון המקדים את Libri-Light הנקי יחד עם CommonVoice ועם מאגרי שיחות טלפון כמו Switchboard ו־Fisher. המטרה היא לייצר ייצוגי שמע שלא נשברים ברגע שההקלטה מגיעה ממיקרופון פח או משיחה סלולרית מקוטעת.

התוצאה היא משקל של 24 שכבות שמכיר מגוון רחב של תנאי שמע באנגלית. החוקרים הראו שאימון מקדים על שמע לא מתויג מהעולם האמיתי מצמצם את פערי הביצועים בשיעור של 66% עד 73% מול נתונים מסביבות שונות. זה אומר שאם תביאו דאטה רועש משלכם, תצטרכו הרבה פחות שעות מתוייגות כדי להגיע לתוצאה סבירה.

מתאים ל

  • בסיס לתמלול הקלטות טלפון

    הוא אומן על שיחות Switchboard ומתמודד היטב עם רוחב פס נמוך ואיכות קו ירודה באנגלית.

  • אימון תמלול עם מעט דאטה

    הייצוגים שלו מקצרים את כמות השעות המתוייגות שצריך להשקיע ב־fine-tuning לדיבור רועש.

  • חילוץ מאפיינים לאודיו

    24 שכבות שמייצרות וקטורים איכותיים מתוך גלי קול גולמיים לצורכי סיווג ועיבוד.

איפה זה נופל

החיסרון הברור והמיידי: אי אפשר לתמלל איתו שום דבר ישירות. הוא מוגדר כ־Wav2Vec2ForPreTraining, מה שאומר שהוא רק יודע לייצר ייצוגים וקטוריים של גלי קול. בנוסף, כל המאגרים שעליהם הוא גדל הם באנגלית, כך שהוא לא יעזור לכם בכלל לעבודה בעברית ללא אימון מקיף מחדש. אם השמע שלכם אינו ב־16 קילו הרץ ולא תדגמו אותו מחדש, תקבלו תוצאות עקומות.

שאלות
נפוצות

אפשר לטעון אותו ולתמלל קובץ mp3 ישר לטקסט?

לא. למודל הזה אין טוקנייזר ואין שכבת מיפוי לאותיות, והוא נועד אך ורק לשמש כבסיס שעליו מאמנים מודל תמלול. כדי לתמלל בפועל, צריך לבצע fine-tuning על נתונים מתויגים עם טוקנייזר מתאים.

המודל מבין עברית או יכול לזהות מילים בעברית?

לא, הוא אומן על מאגרי שמע באנגלית בלבד. אם תזינו לו עברית תקבלו ייצוגים לא מותאמים, ועבור שפות אחרות עדיף לחפש מודלים רב-לשוניים ייעודיים.

איך מריצים

המודל שוקל 1.2 גיגה בייטים בגרסת float32, שזה קל מאוד יחסית ומאפשר להריץ אותו גם על כרטיס מסך פשוט או על מעבד סטנדרטי בלי להזיע. הוא דורש קלט אודיו שנדגם בדיוק ב־16 קילו הרץ, כך שחובה להמיר את קבצי השמע שלכם מראש לקצב הזה דרך הספרייה transformers.

אין פה טוקנייזר ואין שכבת פלט לטקסט, ולכן אין שום טעם לשלוח אליו בקשות ישירות בציפייה לקבל תמלול. אתם חייבים להוסיף ראש מותאם, להגדיר טוקנייזר ולאמן אותו על טקסט מתויג משלכם. אם אתם רק רוצים לתמלל שמע קיים באנגלית בלי להתעסק עם אימונים וכוונונים, חפשו מודל שכבר עבר fine-tuning או קחו שירות מנוהל.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/wav2vec2-large-robust")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים משוחררים תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של המודל, הפצה ושילוב שלו בתוך מוצרים סגורים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים של פייסבוק וצירוף עותק של הרישיון בכל הפצה של התוכנה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗