GPT
W

wav2vec2-large-xlsr-53

קוד פתוח

facebookapache-2.02022-03-02

  • transformers
  • pytorch
  • jax
  • wav2vec2
  • pretraining

בסיס רב-לשוני של פייסבוק לזיהוי דיבור שלמד 53 שפות שונות ישירות מגלי קול. מורידים אותו כדי לקחת ייצוגי דיבור קיימים ולאמן אותם על שפה ספציפית.

  • 2.4 GBמשקל הקבצים
  • 189,554הורדות בחודש
  • 163לייקים
  • 24שכבות

מה זה

המודל אומן על הקלטות אודיו גולמיות בלבד ב־53 שפות שונות, בלי תמלול טקסטואלי מראש. הוא בנוי על ארכיטקטורת wav2vec 2.0 עם 24 שכבות, ולומד ייצוגים פונטיים משותפים בין שפות קרובות ורחוקות באמצעות משימת ניגוד על מקטעי אודיו מוסתרים.

בבדיקות של החוקרים, המודל הציג שיפור יחסי של 72 אחוזים בשגיאות פונמות במבחן CommonVoice בהשוואה לתוצאות קודמות, ושיפור יחסי של 16 אחוזים בשגיאות מילים במבחן BABEL. המשמעות היא שהלמידה הרוחבית על עשרות שפות במקביל מביאה אותו לרמת דיוק טובה יותר ממודלים שאומנו על שפה בודדת בלבד, במיוחד כשאין המון דאטה מתויג לשפה שלכם.

מתאים ל

  • אימון זיהוי דיבור לשפה נדירה

    הבסיס אומן על 53 שפות ומאפשר להגיע לתוצאות טובות גם עם מאגר הקלטות קטן יחסית.

  • חילוץ מאפיינים מקול

    24 שכבות שמייצרות ייצוג וקטורי דחוס מתוך גלי אודיו גולמיים לצורך ניתוח דיבור.

  • זיהוי פונמות רב-לשוני

    המודל הוכיח דיוק משופר של 72 אחוזים בבדיקות זיהוי פונמות מול חלופות מונולינגואליות.

איפה זה נופל

המודל הזה לא מתמלל כלום ישר מהקופסה. מדובר במודל בסיס שחייבים לאמן באימון המשך על נתונים מתויגים של משימת היעד שלכם, כמו זיהוי דיבור. אם תזינו לו קובץ קול בלי אימון כזה, לא תקבלו טקסט. בנוסף, חובה להמיר מראש כל קובץ אודיו לקצב דגימה של 16 קילו-הרץ בדיוק.

שאלות
נפוצות

אפשר להזרים לו קובץ אודיו ולקבל ישר תמלול?

לא. מדובר במודל אימון מקדים בלבד. כדי לקבל טקסט מאודיו אתם חייבים לקחת אותו ולבצע כוונון עדין על דאטה מתויג של דיבור וטקסט.

האם כל פורמט אודיו יעבוד כאן?

הקוד דורש שהאודיו יידגם בקצב של 16 קילו-הרץ. קבצים בקצבי דגימה אחרים ידרשו המרה מוקדמת כדי שהתוצאות יהיו שמישות.

איך מריצים

טוענים את המשקלים דרך ספריית transformers ישירות לקוד פייתון. גודל הקבצים הכולל עומד על 2.4 גיגה-בייט, כך שלא צריך שרת מפלצתי רק כדי לטעון אותו לזיכרון, וכרטיס מסך סטנדרטי עם 8 או 16 גיגה זיכרון יספיק לעבודה שוטפת.

ההגבלה הטכנית המרכזית בהרצה היא קצב הדגימה. האודיו חייב להיכנס בדיוק ב־16 קילו-הרץ, אחרת הייצוגים יתעוותו לחלוטין. אם אין לכם כוח לכוונן את המודל לבד ולדאוג לחומרה, יש שירותי ענן שמציעים ממשקי API מוכנים לתמלול.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/wav2vec2-large-xlsr-53")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 2.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לאמן עליו הלאה ולשלב אותו במוצרים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗