GPT
W

WorldSpeech

קוד פתוח

disco-ethcc-by-nc-4.02026-04-28

  • speech
  • multilingual
  • low-resource
  • parliamentary
  • asr

מעל 65 אלף שעות דיבור מתועדות ב־127 ניבים ושפות עם תמלול אנושי ומדדי איכות צמודים. המאגר נותן חיתוך רחב של דיבור מוסדי וציבורי עם מטא-דאטה שמאפשר סינון מדויק לפני אימון.

  • 48,895הורדות בחודש
  • 43לייקים

מה זה

המאגר מכיל עשרות מיליוני מקטעי שמע בדגימה של 24 קילו-הרץ, שנאספו מפרלמנטים לאומיים, שידורי רדיו וטלוויזיה ציבוריים, ספרי שמע מנחלת הכלל ומוסדות בינלאומיים. כל שורת מידע כוללת תמלול ידני מקורי, תמלול ממודל זיהוי קולי ששימש לסנכרון, שיעור שגיאות תווים ביניהם, הערכת יחס אות לרעש, וארבעה מדדי איכות קול שונים לפי תקן DNSMOS.

המבנה מחולק לפי קונפיגורציות של שפה ואזור גיאוגרפי בתקן BCP-47 וקוד מדינה. מתוך 88 שפות במאגר, 76 כוללות לפחות 10 שעות שמע, ו־24 שפות מגיעות להיקף של מעל 1,000 שעות כל אחת.

מתאים ל

  • אימון מודלי ASR אקדמיים

    אימון ראשוני והערכת מודלים רב-לשוניים לזיהוי דיבור עבור שפות דלות משאבים, תחת תנאי רישיון לא מסחריים.

  • סינון קורפוסים לפי איכות

    בניית שיטות סינון דאטה לאימון קולי בעזרת מדדי איכות האות ושיעור שגיאות התווים שמגיעים מובנים ברשומות.

  • מחקר סיווג ניבים ומבטאים

    זיהוי ויוך מבטאים אזוריים תודות לחלוקה לקודי שפה ומדינה שונים עבור אותה שפת מקור.

איפה זה נופל

איכות השמע הממוצעת נמוכה יחסית, עם ציון כללי של 2.83 בלבד, מה שמעיד על רעשי רקע ואקוסטיקה לא אחידה בהקלטות מפרלמנטים. בנוסף, יש פער עצום בכיסוי בין השפות, כאשר שפות מסוימות מחזיקות אלפי שעות ואחרות פחות מעשר, ועברית כלל אינה מופיעה ברשימת השפות של המאגר. סגנון הדיבור מוטה בבירור לנאומים רשמיים, הקראת ספרים ושידורים ממוסדים, לכן הוא פחות מייצג שיחות יומיומיות ספונטניות.

שאלות
נפוצות

האם יש במאגר עברית?

לא. המאגר מכסה שפות רבות באזור כמו ערבית על מגוון ניביה, אך עברית אינה נכללת ברשימת השפות שפורסמה. מפתחים שמחפשים דאטה לזיהוי קולי בעברית יצטרכו לחפש מקורות אחרים.

האם מותר להשתמש במאגר לפרויקט מסחרי?

ממש לא. המאגר מופץ תחת רישיון CC BY-NC 4.0 המיועד לשימוש לא מסחרי בלבד. אימון מודל המיועד למכירה או להטמעה במוצר רווחי מפר את תנאי הרישיון.

מה מקור ההקלטות?

האודיו לוקט ממקורות ציבוריים מגוונים שכוללים פרוטוקולים מוקלטים של פרלמנטים, רשתות שידור ממלכתיות וספרי שמע חופשיים מפרויקטים ציבוריים. התמלולים מבוססים על הטקסט האנושי המקורי שהגיע עם המקורות הללו, לצד בדיקות התאמה אוטומטיות.

איך מסננים הקלטות באיכות נמוכה?

כל רשומה מגיעה עם ציוני איכות מחושבים מראש של רעש רקע, איכות אות וציון MOS כללי. אפשר פשוט להגדיר סף מספרי על עמודות ה־snr ו־dnsmos_ovr בזמן הטעינה ולסנן החוצה מקטעים רועשים.

איך טוענים

טוענים את המאגר ישירות בספריית datasets לפי שפה ספציפית, כמו nl_nl או af_za. מכיוון שמדובר באלפי קבצי פרקט ו־65 אלף שעות שמע מקודדות בפורמט אופוס, שווה לעבוד במצב streaming ולא להוריד את כל הדאטה לדיסק המקומי. השדות החשובים לסינון ראשוני הם snr, cer ו־dnsmos_ovr, שמאפשרים לזרוק הקלטות מטושטשות או תמלולים פגומים עוד לפני שמזרימים את האודיו למודל.

from datasets import load_dataset

ds = load_dataset("disco-eth/WorldSpeech")

הרישיון

הרישיון הוא CC BY-NC 4.0, מה שאוסר כל שימוש מסחרי בנתונים. מותר להשתמש במאגר למחקר, פיתוח פנימי והערכה, בתנאי שנותנים ייחוס הולם למפרסמים. שימוש בנתונים לאימון מודל שיופץ באופן מסחרי מהווה הפרת רישיון, כך שהדאטהסט סגור בפני מוצרים בתשלום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗