GPT
A

afrispeech-200

קוד פתוח

intronhealthcc-by-nc-sa-4.02023-01-30

מאגר הקלטות שמע באנגלית של דוברים ממוצא אפריקאי, חצי ממנו בעולם הרפואי. מי שבונה מודל זיהוי דיבור למבטאים כבדים שאינם מערביים ימצא כאן גיוון שקשה להשיג במקום אחר.

  • 2,425הורדות בחודש
  • 37לייקים

מה זה

המאגר מכיל 67,577 הקלטות של משפטים מוקראים באנגלית מפי 2,463 דוברים שונים, בהיקף של כמאתיים שעות שמע. ההקלטות חולקו לשני תחומים עיקריים, התחום הרפואי שכולל מעל 41 אלף קטעים, והתחום הכללי שכולל מעל 25 אלף קטעים. הדוברים תרמו את קולם באופן מקוון והקליטו משפטים בודדים בסביבה שקטה עם מיקרופון איכותי.

כל רשומה במאגר כוללת קובץ שמע, תמלול טקסטואלי, מזהה דובר, קבוצת גיל, מגדר, מדינה, מבטא ותחום. החלוקה הפנימית מפרידה את הדוברים בין קבוצות האימון, הפיתוח והבדיקה ללא חפיפה ביניהן, כאשר סט האימון מכיל כ־173 שעות שמע ו־71 מבטאים שונים, וסט הבדיקה כולל קרוב ל־19 שעות שמע עם ייצוג רחב של 108 מבטאים.

מתאים ל

  • אימון זיהוי דיבור רפואי

    פיתוח מודלי תמלול לקליניקות שמתמודדים עם מונחים רפואיים באנגלית הנאמרים במבטא אפריקאי.

  • בדיקת עמידות מודלים

    הערכת ביצועים של מנועי זיהוי דיבור קיימים מול מגוון רחב של 120 מבטאים שונים באנגלית.

  • אימון מודלי הקראה

    הפקת דיבור מלאכותי באנגלית עם מאפייני הגייה ואינטונציה אותנטיים של יבשת אפריקה.

איפה זה נופל

ההטיה הגיאוגרפית במאגר חריגה. ניגריה מייצגת מעל 142 שעות מתוך המאגר כולו, בעוד שמדינות אחרות מקבלות ייצוג זעום של דקות ספורות. נוסף לכך, אין תיעוד בכרטיס על תהליך הסינון או המדרגים שבדקו את התמלולים. אין כאן מילה אחת בעברית, כל הטקסטים הם באנגלית בלבד. חשוב גם לזכור שההקלטות בוצעו בתנאי הקראה של משפטים בודדים, כך שהן לא מייצגות שיחה טבעית או רעשי רקע של מרפאה אמיתית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC BY-NC-SA 4.0, מה שאוסר שימוש מסחרי מכל סוג. כל פיתוח או מודל שנגזר מהדאטהסט חייב להישאר במסגרת מחקרית ולהיות מופץ תחת אותו רישיון חופשי.

כמה שטח דיסק נדרש כדי לעבוד עם המאגר?

המאגר המלא שוקל כ־120 גיגה בייט. אפשר לעקוף את ההורדה הכבדה באמצעות שימוש במצב הזרמה של ספריית הנתונים, או להוריד רק מבטא בודד שמעניין אתכם על ידי ציון השם שלו בטעינה.

האם יש במאגר הקלטות בשפות אפריקאיות מקומיות או בעברית?

לא, כל ההקלטות הן באנגלית בלבד. השונות אינה בשפת הדיבור אלא במבטאים של הדוברים, המגיעים משפות אם ומאזורים שונים ברחבי אפריקה.

איך נאספו קובצי השמע והתמלולים?

המידע מבוסס על תרומת קול מקוונת של משתמשים שהקריאו משפטים מוכנים מראש לתוך מיקרופון. כרטיס המאגר אינו מפרט את הליך בקרת האיכות של התמלולים או את זהות המתקפים.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות פקודת load_dataset רגילה עם שם המאגר. אין צורך באישור גישה ידני, אך נפח ההורדה המלא עומד על כ־120 גיגה בייט. אם שטח האחסון מוגבל, מומלץ להפעיל מצב הזרמה עם streaming=True או להגדיר תצורה ספציפית לפי שם המבטא הרצוי, למשל isizulu. שדות המפתח הם audio שמכיל את המערך המפוענח בקצב דגימה של 44.1 קילו-הרץ, ו־transcript שמכיל את הטקסט המוקרא.

from datasets import load_dataset

ds = load_dataset("intronhealth/afrispeech-200")

הרישיון

הרישיון הוא CC BY-NC-SA 4.0. המשמעות ברורה, אסור לעשות שום שימוש מסחרי בנתונים או במודלים שאומנו עליהם. אם אימנתם מודל על המאגר הזה, אתם מחויבים לתת קרדיט ליוצרים ולשחרר את הנגזרות תחת אותו רישיון בדיוק. המאגר מיועד אך ורק למחקר.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗