GPT
W

wav2vec2-xls-r-2b

קוד פתוח

facebookapache-2.02022-03-02

  • transformers
  • pytorch
  • wav2vec2
  • pretraining
  • speech

בסיס לעיבוד דיבור רב לשוני שאומן על מאות אלפי שעות הקלטה ב־128 שפות. תרצו אותו רק כנקודת מוצא לכוונון עדין למשימות כמו תמלול ותרגום.

  • 8.1 GBמשקל הקבצים
  • 2,999הורדות בחודש
  • 45לייקים
  • 48שכבות

מה זה

מדובר במודל ייצוג קולי רב לשוני מבית פייסבוק שמכיל שני מיליארד פרמטרים. הוא עבר אימון מקדים על 436 אלף שעות של דיבור לא מתוייג ממקורות כמו VoxPopuli, MLS ו־CommonVoice, ומכסה 128 שפות שונות. הוא נועד לקחת שמע גולמי ולייצר ממנו ייצוגים עמוקים שמתאימים למשימות שונות במורד הזרם.

היתרון המרכזי שמוצג במחקר הוא ביצועים טובים יותר ככל שעולים בגודל. במבחני זיהוי דיבור כמו BABEL ו־CommonVoice הוא מציג ירידה של עשרים עד שלושים ושלושה אחוזים בשיעור השגיאות ביחס למודלים קודמים. במבחן CoVoST-2 לתרגום דיבור לאנגלית הוא רשם שיפור ממוצע של 7.4 נקודות BLEU על פני 21 כיווני תרגום, והציג תוצאות מובילות גם בזיהוי שפות מתוך שמע ב־VoxLingua107.

בניגוד למודלים שמגיעים מוכנים לתמלול מהקופסה, הגרסה הזו כוללת רק את שכבות הבסיס. מי שיוריד אותה יקבל ארכיטקטורה של 48 שכבות בפורמט Wav2Vec2ForPreTraining, שמחייבת הוספת ראש ספציפי ואימון נוסף כדי להגיע לטקסט כתוב.

מתאים ל

  • אימון מודל תמלול ייעודי

    נקודת פתיחה חזקה לכוונון עדין על שפות ספציפיות, שמקצרת זמני אימון ומורידה שיעורי שגיאה.

  • זיהוי שפה מתוך קובץ שמע

    הארכיטקטורה הוכיחה תוצאות שיא במבחן VoxLingua107 ומסוגלת לסווג קטעי דיבור בין עשרות שפות שונות.

  • תרגום ישיר מדיבור לאנגלית

    המודל הציג שיפור משמעותי במדד BLEU במבחני תרגום ישיר מקול לטקסט מתוך 21 שפות מקור.

איפה זה נופל

החיסרון הברור ביותר הוא שהמודל הזה פשוט לא עובד ישר מהקופסה. אם תתנו לו קובץ שמע, לא תקבלו תמלול ולא תרגום, אלא וקטורים מתמטיים בלבד. כרטיס המודל מבהיר מפורשות שחייבים לבצע fine-tuning לפני שאפשר לעשות איתו משהו שימושי במוצר.

בנוסף, הוא קשיח מאוד בדרישות הקלט שלו ומחייב המרה מוקדמת של כל שמע ל־16kHz. אם תנסו להזין קבצים בקצב דגימה שונה בלי טיפול מקדים, העיבוד פשוט לא יהיה תקין.

אותה משפחה

wav2vec2-xls-r יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להוריד את המודל ולהתחיל לתמלל שיחות בעברית?

לא. מדובר במודל אימון מקדים בלבד ללא שכבת פלט של טקסט. כדי להפיק ממנו תמלול בפועל צריך לאמן אותו עם נתונים מתוייגים של קול וטקסט.

איזה פורמט אודיו המודל יודע לקבל?

הקלט חייב להיות שמע שנדגם בקצב של 16 קילוהרץ. אם יש לכם הקלטות בקצב אחר, תצטרכו להמיר אותן מראש לפני ההזנה לרשת.

איך מריצים

המשקל הכולל של הקבצים עומד על 8.1 גיגה בייט בדיוק float32, כך שכדי לטעון אותו עם ספריית transformers של פייתון תצטרכו כרטיס מסך עם זיכרון ייעודי משמעותי, בטח אם אתם מתכננים לכייל אותו בעצמכם. שמע הכניסה חייב להיות בקצב דגימה של 16 קילוהרץ בלבד, אחרת התוצאות ישתבשו לגמרי.

פייסבוק הוציאה למשפחה הזו גם גרסאות קטנות יותר של 300 מיליון ומיליארד פרמטרים. אם אין לכם שרת ייעודי לאימונים כבדים, עדיף לבדוק קודם את הגרסאות הקטנות או לחפש מודלים שכבר עברו כוונון למשימה שלכם, כי להחזיק תשתית לכוונון של שני מיליארד פרמטרים זה עסק יקר ומסורבל.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/wav2vec2-xls-r-2b")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 8.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה של תוצרים, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗