GPT
O

open-asr-leaderboard

קוד פתוח

hf-audioרישיון לא דווח2024-06-21

ערכת מבחן ממוינת לפי אורך אודיו בפורמט Parquet, שנועדה לבדיקת ביצועי מודלי תמלול על שמונה מאגרי דיבור שונים.

  • 16,103הורדות בחודש
  • 73לייקים

מה זה

המאגר מכיל דגימות שמע ותמלולים שנלקחו משמונה מקורות שונים במסגרת פרויקט ESB: LibriSpeech, Common Voice, VoxPopuli, TED-LIUM, GigaSpeech, SPGISpeech, Earnings-22 ו־AMI. המקורות מכסים הקלטות של ספרי שמע, שיחות ועידה כספיות, נאומים פוליטיים מישיבות הפרלמנט האירופי, הרצאות ופגישות עבודה ספונטניות. כל רשומה כוללת מזהה ייחודי, נתיב לקובץ, מערך נתוני האודיו המפוענח בקצב דגימה של 16 קילוהרץ, הטקסט המתומלל ושם המאגר המקורי.

הטקסטים עברו תיקוני שגיאות בסיסיים כמו הסרת תווים לא מזוהים והמרת פיסוק מילולי לסימני פיסוק, אך לא עברו עיבוד מעבר לכך. בחלק מהמקורות הטקסט שומר על אותיות גדולות וקטנות ופיסוק, ובחלקם הוא מנורמל בלבד. הקבצים בגרסה הזו עברו מיון מחדש לפי אורך קטעי השמע, מהארוך לקצר, והוסבו לפורמט Parquet ישיר במקום סקריפטי טעינה ישנים.

מתאים ל

  • הערכת מודלי דיבור

    בדיקת ביצועי מודלי תמלול על מגוון סגנונות דיבור, מאודיובוקס ועד פגישות מרובות משתתפים.

  • מבחני עומס לפי אורך

    הרצת בדיקות תמלול המסודרות מראש מקטעי שמע ארוכים לקצרים כדי לבחון זיכרון ומהירות.

  • בנצ'מרק מדדים מול לוח תוצאות

    השוואת שיעורי שגיאות מילים ישירות מול לוחות הדירוג הרשמיים של הקהילה.

איפה זה נופל

הנתונים כולם באנגלית ומכילים סגנונות דיבור מגוונים, החל מהקראה נקייה ועד שיחות ספונטניות מרובות דוברים ומבטאים, אך אין כאן כיסוי לשפות אחרות. בעוד שהכרטיס מציין תיאורטית שקיימים ספליטים לאימון, במאגר הספציפי הזה הקבצים הם קובצי מבחן בלבד והתמלולים בחלק מפיצולי הבדיקה המקוריים אינם גלויים לצורך דירוג הוגן. בנוסף, חוסר האחידות בפורמט התמלול בין המקורות, חלקם כוללים פיסוק וחלקם ללא אותיות גדולות, מחייב התאמה ידנית של המודל לפי מקור המידע.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

זה תלוי בחלק שבו אתם משתמשים. חלק מהמאגרים כמו LibriSpeech ו־Common Voice מאפשרים שימוש מסחרי, אבל TED-LIUM אוסר זאת מפורשות ו־SPGISpeech כפוף להסכם משתמש נפרד. אם המטרה היא מוצר מסחרי, חובה לסנן החוצה את החלקים בעלי הרישיונות המגבילים.

האם יש במאגר דגימות בעברית?

לא, המאגר מורכב כולו מהקלטות באנגלית בלבד. המקורות השונים כוללים אמנם מגוון מבטאים של דוברים שאינם ילידיים, כמו בנתוני הפרלמנט האירופי, אך שפת הדיבור נשארת אנגלית. לפיתוח מודלים בעברית תצטרכו לפנות למאגרים אחרים.

במה המאגר הזה שונה מגרסאות ESB האחרות?

המאגר הזה לוקח את קובצי הבדיקה בלבד וממיר אותם לפורמט Parquet בטוח, ללא צורך בהרצת סקריפטים חיצוניים שעלולים להוות סיכון אבטחה. בנוסף, כל הדגימות מוינו מראש לפי משך קטע השמע בסדר יורד. המבנה הזה מקל על בדיקות יעילות ומייתר תהליכי עיבוד מקדימים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות פקודת load_dataset עם המזהה הרלוונטי ושם הפיצול המבוקש. המאגר כולל 101 קבצים בסך הכל בפורמט Parquet, ללא צורך בהרצת קוד מרוחק. לחלק מהתת-מאגרים כמו Common Voice, GigaSpeech ו־SPGISpeech נדרש אישור גישה מראש ומעבר עם טוקן אימות. בעבודה עם עמודת האודיו מומלץ לגשת קודם לאינדקס השורה ורק אז לשדה השמע, כדי למנוע פענוח ודגימה מחדש של כל המאגר בבת אחת.

from datasets import load_dataset

ds = load_dataset("hf-audio/open-asr-leaderboard")

הרישיון

למאגר עצמו לא הוגדר רישיון אחיד כולל. בפועל מדובר באוסף שנגזר ממקורות שונים, ולכל מקור רישיון נפרד לחלוטין: החל מרישיונות פתוחים כמו CC0 ו־CC-BY-4.0, דרך Apache 2.0, ועד רישיונות מגבילים כמו CC-BY-NC-ND 3.0 של TED-LIUM שאוסר שימוש מסחרי, או הסכמי שימוש פרטיים כמו ב־SPGISpeech. אי אפשר להתייחס למאגר כמקשה אחת, ושימוש מסחרי במודל שמתבסס עליו תלוי בסינון המקורות הספציפיים שבהם משתמשים.

הרישיון המלא ב־Hugging Face ↗