GPT
X

xtreme_s

קוד פתוח

googlecc-by-4.02022-03-04

  • speech-recognition

בנצ'מרק שמקבץ הקלטות אודיו ב־102 שפות עבור ארבע משימות שונות של עיבוד דיבור. הוא מיועד למי שצריך להעריך ביצועי מודלים רב-לשוניים תחת תנאי אימון אחידים.

  • 1,401הורדות בחודש
  • 72לייקים

מה זה

המאגר מאגד בתוכו מספר מקורות חיצוניים קיימים ומחלק אותם לפי משימות ספציפיות. לזיהוי דיבור נכללים FLEURS שמבוסס על תרגום טקסטים מקבילים, Multilingual LibriSpeech שנגזר מספרי שמע מוקראים, ו־VoxPopuli שנאסף מהקלטות דיוני הפרלמנט האירופי בשנים 2009 עד 2020. לצד אלה קיים גם BABEL של שיחות טלפון, אך הוא דורש הורדה נפרדת.

לתרגום דיבור נכלל CoVoST-2 בכיוון של שפות שונות לאנגלית, שבו היקף המידע נע בין שעה בודדת ביפנית ועד 180 שעות בצרפתית. לסיווג דיבור משמש FLEURS בזיהוי שפה ו־Minds-14 שמכיל הקלטות של פניות קוליות בנושאי בנקאות דיגיטלית ב־14 שפות וסיווג כוונות. לבסוף, משימת שליפת מידע קולי נשענת על FLEURS להשוואה בין הקלטות ותרגומן.

מתאים ל

  • הערכת זיהוי דיבור רב-לשוני

    בדיקת ביצועי ASR על פני עשרות שפות מגוונות תחת סביבות הקלטה שונות של ספרי שמע ונאומים.

  • תרגום קולי לאנגלית

    אימון ובחינה של מודלי תרגום דיבור ישיר משפות שונות עם כמויות דאטה משתנות דרך CoVoST-2.

  • זיהוי כוונות קוליות במוקדים

    סיווג פניות משתמשים בתחום הבנקאות ב־14 שפות שונות לצורך ניתוב אוטומטי של שיחות באמצעות Minds-14.

איפה זה נופל

חלק גדול מההקלטות, במיוחד מ־LibriSpeech ו־CoVoST-2, מבוסס על קריאת טקסטים ולא על דיבור ספונטני או שיחות רקע רועשות. יש פער שעות קיצוני בין שפות עשירות במשאבים לבין שפות דלות משאבים, כך שהביצועים לא יהיו אחידים. בנוסף, חלק ממקורות המידע לא כוללים ייצוג מלא לכל 102 השפות שהבנצ'מרק מציג, ויש לבדוק את הכיסוי המדויק בכל תת-משימה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא רישיון cc-by-4.0 אשר מתיר שימוש מסחרי ישיר. עליכם לתת קרדיט למחברים בהתאם לדרישות הרישיון. שימו לב שאם אתם משתמשים בחלקים אופציונליים כמו BABEL, חלים עליהם תנאי רישוי והרשמה נפרדים מול LDC.

כמה מקום בדיסק נדרש כדי להוריד את כל הדאטה?

המאגר כולו שוקל כ־3,500 גיגה-בייט אם מורידים את כל החלקים יחד. חלק הארי שייך ל־MLS שתופס 2,700 גיגה-בייט, בעוד FLEURS דורש 350 גיגה-בייט ו־Minds-14 דורש 5 גיגה-בייט בלבד. מומלץ מאוד לטעון רק את המשימות והשפות הספציפיות שבהן אתם עוסקים.

האם המאגר כולל תמיכה בעברית?

הבנצ'מרק כולל עברית ברשימת השפות של אזור המזרח התיכון, בעיקר דרך תת-המאגר FLEURS. עם זאת, עברית אינה מיוצגת בכל משימות המשנה, למשל ב־MLS שמכיל 8 שפות בלבד או ב־Minds-14. כדאי לבדוק בקוד הטעינה של כל תת-משימה אם קיימת תצורה עבור עברית לפני תחילת העבודה.

איך הדאטה נאסף והוכן?

הבנצ'מרק הוא איחוד של מספר מאגרים קיימים שעברו התאמה למבנה אחיד. הנתונים מגיעים מקריאת ספרי שמע ציבוריים, הקלטות רשמיות של הפרלמנט האירופי, ותרגומים מקבילים לפרויקט FLORES. צוות הפיתוח הגדיר פיצולים רשמיים וסטנדרטיים לצורך השוואת ביצועים אמינה במחקר.

איך טוענים

טוענים תתי-קבוצות באמצעות ספריית datasets עם ציון המקור והשפה הרצויה, למשל fleurs.af_za. המאגר המלא תופס כ־3,500 גיגה-בייט, מתוכם 2,700 שייכים ל־MLS ו־350 ל־FLEURS, ולכן מומלץ לטעון רק את התצורה המדויקת. אם טוענים את VoxPopuli, חייבים להוריד 100 גיגה-בייט בבת אחת כי השפות שזורות זו בזו. הקבצים מכילים מערכי שמע גולמיים לצד שדות תמלול, מזהי שפה, תרגום או כוונה בהתאם למשימה.

from datasets import load_dataset

ds = load_dataset("google/xtreme_s")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שניתן קרדיט מתאים ליוצרים. אימון מודל על הנתונים אינו מחייב שחרור של המודל תחת אותו הרישיון, אך יש לשים לב שלחלק מהמקורות החיצוניים כמו BABEL יש תנאי גישה נפרדים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗