GPT
P

peoples_speech

קוד פתוח

MLCommonscc-by-2.0,cc-by-2.5,cc-by-3.0,cc-by-4.0,cc-by-sa-3.0,cc-by-sa-4.02022-08-16

  • robust-speech-recognition
  • noisy-speech-recognition
  • speech-recognition

מעל שלושים אלף שעות של דיבור באנגלית עם תמלול ברישיון פתוח. המאגר נבנה כדי לאפשר אימון מערכות זיהוי דיבור בקנה מידה עצום ובלי להסתבך עם זכויות יוצרים מסחריות.

  • 71,235הורדות בחודש
  • 284לייקים

מה זה

כל רשומה במאגר כוללת מזהה ייחודי, קובץ שמע שנדגם בקצב של 16 קילו-הרץ, משך הזמן במילי-שניות ותמלול טקסטואלי. החומרים מגיעים כולם מ־archive.org, וכוללים הקלטות מגוונות כמו דיונים משפטיים של בתי משפט בארצות הברית, נאומים ציבוריים והיסטוריה מדוברת. הצוות הוריד רק תכנים שכבר היה להם תמלול קיים, ולא ביצע תמלול ידני חדש עבור סט האימון.

המאגר מחולק לקונפיגורציות לפי סוג הרישיון ורמת הניקיון. יש חלוקה ל־cc-by-clean ו־cc-by-dirty, לצד חלוקות מקבילות של cc-by-sa-clean ו־cc-by-sa-dirty, כשיש גם גרסת microset קטנה. עבור סטים של בדיקה ותיקוף נשכרו דוברי אנגלית אמריקאית שיתמללו את ההקלטות באופן ידני, בעוד שבסט האימון חלק מהתמלולים מגיעים כנראה ממערכות זיהוי דיבור אוטומטיות.

מתאים ל

  • אימון מודלי ASR

    בניית מודלים גדולים לזיהוי דיבור באנגלית על בסיס עשרות אלפי שעות מגוונות ברישיון מסחרי.

  • זיהוי מילות מפתח

    אימון מערכות לזיהוי ביטויים ספציפיים בהקלטות מרובות רעשים ואיכויות שונות מהשטח.

  • בנצ'מרק להערכת מודלים

    הערכת ביצועי מודלי שמע על סטי הבדיקה שתומללו ידנית על ידי דוברי אנגלית שפת אם.

איפה זה נופל

זה לא מאגר מושלם. היוצרים מודים בגרסה 1.0 בחוסר תיאום בין השמע לטקסט, יש מילים שמופיעות בתמלול ולא נשמעות בהקלטה, ולהפך. הנתונים תלויים במה שאנשים העלו לארכיון הציבורי, כמעט כל הדוברים הם במבטא אמריקאי, ובסט האימון איכות התמלול לא מבוקרת. בנוסף יש רעשי רקע בחלק מההקלטות, כך שזה לא מתאים למשימות עדינות כמו סינתוז דיבור בלי סינון אגרסיבי.

שאלות
נפוצות

האם אפשר להשתמש במאגר למוצר מסחרי?

כן, אבל צריך להיזהר בבחירת הקונפיגורציה. תת המאגר שמסומן ב־cc-by מתאים לשימוש מסחרי תחת ייחוס, בעוד שקבצים תחת cc-by-sa כוללים דרישת שיתוף זהה שעשויה לכבול אתכם.

האם יש במאגר הקלטות בעברית?

לא. המאגר מוגדר וממוקד בשפה האנגלית בלבד, ורובו המוחלט מורכב מדוברים במבטא אמריקאי. הוא לא יעזור באימון מודלים מקומיים לעברית.

מאיפה הגיעו כל ההקלטות?

הנתונים נמשכו ישירות מה־API של archive.org. המקורות כוללים תכנים ממשלתיים ומשפטיים, דיונים ציבוריים והקלטות היסטוריות שהועלו לשם עם תמלול קיים ברישיון מתאים.

האם איכות התמלול אמינה לאימון ישיר?

בחלקה כן ובחלקה פחות. בעוד שסט הבדיקה תומלל ידנית בידי אנשים, סט האימון כולל תמלולים שנוצרו במקור על ידי מערכות זיהוי דיבור ישנות, וחלק מהמילים לא תואמות את השמע במדויק.

איך טוענים

הנתונים מחולקים לאלפי קבצי parquet, ולא נדרש תהליך אישור מיוחד כדי לגשת אליהם בהאגינג פייס. בגלל שמדובר בעשרות אלפי שעות שמע, מומלץ להוריד קודם את קונפיגורציית ה־microset או לבדוק תתי-קבצים בודדים של בדיקה לפני שמזרימים את כל המאגר. השדות המרכזיים שמעניינים אתכם בקוד הם audio לצורך חילוץ מערך הנתונים ו־text עבור תווית המטרה.

from datasets import load_dataset

ds = load_dataset("MLCommons/peoples_speech")

הרישיון

המאגר מופץ תחת תערובת של רישיונות Creative Commons, כולל CC-BY ו־CC-BY-SA בגרסאות שונות. החלוקה בקבצים מאפשרת לבחור בגרסת CC-BY בלבד, שמתאימה לשימוש מסחרי רגיל תחת מתן קרדיט. אם אתם משתמשים בחלקי ה־SA, תצטרכו לשחרר נגזרות תחת אותו רישיון שיתופי, עניין בעייתי לחברות שרוצות מודל קנייני סגור.

הרישיון המלא ב־Hugging Face ↗