GPT
L

librispeech_asr

קוד פתוח

openslrcc-by-4.02022-03-02

אלף שעות הקראה באנגלית מפרויקט ספרי השמע LibriVox, מחולקות לרמות איכות ורעש. זהו בנצ'מרק מרכזי לזיהוי דיבור שבוחן דיוק תמלול באמצעות שגיאות מילים.

  • 57,340הורדות בחודש
  • 243לייקים

מה זה

הנתונים מבוססים על הקראת ספרי שמע בקצב דגימה של 16kHz, שעברו חיתוך והתאמה לטקסט המקורי. כל רשומה כוללת קובץ שמע, תמלול טקסטואלי, מזהה דובר ומזהה פרק בספר. החלוקה נעשתה בעזרת מודל שחישב שיעור שגיאות מילים מול מודל אקוסטי, כדי למיין את ההקלטות לשתי רמות קושי עיקריות.

האימון מחולק לשלושה מקטעים מרכזיים. קבוצת הניקיון כוללת 100 שעות של 28,539 קטעים ברמת איכות גבוהה ומבטא קרוב לאנגלית אמריקאית, ועוד 360 שעות עם 104,014 קטעים. קבוצת הרעש, שמוגדרת כקשה יותר, מונה כ־500 שעות עם 148,688 קטעים. חלוקות האימות והבדיקה מופרדות גם הן לנקיות ורועשות, עם בין 2,620 ל־2,939 קטעים בכל קובץ בדיקה.

מתאים ל

  • אימון מודלי תמלול באנגלית

    בניית מערכות זיהוי דיבור עם חלוקה בין הקלטות נקיות לקשות יותר.

  • הערכת ביצועי מודלים

    מדידת שיעור שגיאות מילים בבנצ'מרקים מקובלים בתחום השמע.

  • זיהוי דוברים

    אימון מערכות לזיהוי קולות שונים באמצעות שדה מזהה הדובר.

איפה זה נופל

ההקלטות הן של ספרי שמע בלבד, כך שמדובר בדיבור מוקרא וברור ולא בשיחה טבעית או יומיומית. אין כאן עברית, השפה היא אנגלית בלבד עם העדפה ברורה למבטא אמריקאי בחלקים הנקיים. נוסף על כך, הכרטיס מציב מגבלה ישירה: אסור לנסות לחשוף את זהות האנשים שתרמו את קולם לפרויקט.

שאלות
נפוצות

האם יש בדאטהסט תמיכה בעברית?

לא. כל ההקלטות והתמלולים הם באנגלית בלבד, בעיקר במבטאים שקרובים לאנגלית אמריקאית. אם אתם מחפשים לאמן מערכת בעברית, הנתונים האלה לא יעזרו.

האם מותר להשתמש בו לפיתוח מוצר מסחרי?

כן. הרישיון מסוג CC-BY 4.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים למוצרים סגורים. התנאי היחיד הוא לתת ייחוס הולם ליוצרי המאגר.

מאיפה הגיעו כל ההקלטות האלה?

האודיו מבוסס על ספרי שמע שהוקראו במסגרת פרויקט LibriVox שבו מתנדבים תורמים את קולם. החוקרים חתכו את ההקלטות, הצליבו אותן עם הטקסט של הספרים וסיווגו אותן לפי איכות.

איך טוענים

המאגר מפוצל ל־262 קבצים, בעיקר בפורמט parquet, וזמין להורדה ישירה ללא צורך בהרשמה מראש או בקשת גישה. בזמן הטעינה, עמודת השמע מחלצת את האודיו ומבצעת פענוח מחדש, תהליך שצורך זיכרון רב אם ניגשים ישירות לכל העמודה. כדי למנוע צוואר בקבוק, עדיף לגשת קודם למזהה השורה הספציפי ורק אז לשלוף את נתוני האודיו והתמלול.

from datasets import load_dataset

ds = load_dataset("openslr/librispeech_asr")

הרישיון

הרישיון הוא CC-BY 4.0. מותר להשתמש במידע למטרות מסחריות ומחקריות, לשנות אותו ולאמן עליו מודלים חופשיים או מסחריים. התנאי המרכזי הוא מתן קרדיט וייחוס מתאים ליוצרים המקוריים, אך אין דרישה לשתף את המודל המאומן באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗