GPT
W

wav2vec2-xls-r-300m

קוד פתוח

facebookapache-2.02022-03-02

  • transformers
  • pytorch
  • wav2vec2
  • pretraining
  • speech

בסיס לעיבוד אודיו ב־128 שפות שאומן על מאות אלפי שעות הקלטה. מתאים למי שבונה זיהוי דיבור או סיווג שמע וצריך נקודת זינוק קלה להרצה מקומית.

  • 1.2 GBמשקל הקבצים
  • 599,828הורדות בחודש
  • 134לייקים
  • 24שכבות

מה זה

מדובר במודל ייצוג קולי רב־לשוני של פייסבוק, שאומן בשיטת לימוד עצמי על 436 אלף שעות דיבור ללא תיוג ממאגרים כמו VoxPopuli, CommonVoice ו־BABEL. הוא תומך ב־128 שפות ומכיל 24 שכבות בארכיטקטורת wav2vec 2.0. המטרה שלו היא לקחת גלי קול גולמיים ולהמיר אותם לייצוגים וקטוריים שמבינים מבנה שפתי.

בגרסה הזו של 300 מיליון פרמטרים מקבלים את הגודל הקומפקטי ביותר במשפחת XLS-R, שמגיעה עד שני מיליארד פרמטרים. לפי נתוני המחקר של המפתחים, סדרת המודלים הזו הורידה שגיאות בזיהוי דיבור ב־20% עד 33% יחסית לעבודות קודמות במאגרים שנבדקו, ושיפרה את התרגום בציון ממוצע של 7.4 נקודות BLEU. הגרסה הנוכחית נותנת את האיזון הטוב ביותר בין ביצועים לצריכת משאבים סבירה.

מתאים ל

  • בסיס לכוונון תמלול דיבור

    מכיל ייצוגים מוקדמים של 128 שפות ומאפשר לאמן מפענח ASR על כמות קטנה של שעות מתויגות.

  • זיהוי שפה מקטעי קול

    ארכיטקטורת הבסיס קבעה תוצאות שיא על מאגר VoxLingua107 ומתאימה לסיווג מקור הדובר.

  • תרגום ישיר מדיבור

    מתאים לחיבור שכבות פענוח תרגום לאנגלית, עם שיפור מוכח של 7.4 נקודות BLEU במבחני CoVoST-2.

איפה זה נופל

זה לא מוצר מדף שזורקים אליו קובץ ומקבלים טקסט. המודל יצא מאימון מקדים בלבד בארכיטקטורת Wav2Vec2ForPreTraining, והיוצרים מציינים במפורש שחובה לבצע fine-tuning למשימה מוגדרת כמו זיהוי דיבור, סיווג או תרגום לפני שרואים ממנו תועלת. מי שיריץ אותו ישירות מהקופסה יקבל רק וקטורים מתמטיים ולא תמלול.

בנוסף, הוא קשיח מאוד לגבי נתוני הכניסה. האודיו חייב להגיע בקצב דגימה של 16kHz בלבד, וכל חריגה תחייב המרה מוקדמת בצד שלכם.

אותה משפחה

wav2vec2-xls-r יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להעלות קובץ ולקבל תמלול מיידי?

לא. המודל שוחרר כמודל בסיס ללא שכבת פלט של טקסט. כדי לתמלל צריך לחבר לו ראש מתאים, להגדיר מילון תווים ולאמן אותו על נתוני דיבור עם כתוביות.

האם הוא דורש הכנת אודיו מיוחדת לפני ששולחים אליו מידע?

כן, יש דרישה טכנית ברורה שההקלטה תהיה בקצב דגימה של 16kHz בדיוק. אם הקלט מגיע בפורמט אחר, תצטרכו לדגום אותו מחדש בקוד לפני ההזנה למודל.

איך מריצים

טוענים את המשקלים ישירות דרך ספריית transformers בפייתון. הקבצים שוקלים 1.2 גיגה־בייט בדיוק float32, כך שכרטיס מסך בסיסי עם 4 עד 8 גיגה זיכרון יספיק בקלות להסקה ואפילו לכוונון עדין עם באצ'ים קטנים. חובה לוודא שכל קלט שמע נדגם מראש בדיוק בקצב של 16kHz, אחרת התוצאות ייפגעו לחלוטין.

אם אתם צריכים דיוק מרבי בשפות עם מעט דאטה ויש לכם שרתים כבדים, עדיף להסתכל על גרסאות ה־1B או 2B של אותה סדרה. מנגד, אם אין לכם כוונה לאמן שכבות ספציפיות למשימה שלכם וכל מה שאתם מחפשים זה תמלול מוכן מחר בבוקר, עדיף לקחת מודל שכבר עבר fine-tuning או שירות מוכן.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/wav2vec2-xls-r-300m")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לכוונן אותו על נתונים פרטיים ולהפיץ אותו כחלק ממוצר סגור. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗