GPT
S

speech-wikimedia

קוד פתוח

MLCommonsרישיון לא דווח2023-06-26

המאגר מרכז מעל אלפיים שעות שמע מויקימדיה קומונס עם תמלולים קיימים. הוא מעניין למי שמחפש חומרי דיבור היסטוריים וציבוריים מגוונים מעבר להקלטות אולפן רגילות.

  • 16,473הורדות בחודש
  • 14לייקים

מה זה

המאגר כולל קובצי שמע שחולצו מקובצי וידאו שהועלו לויקימדיה קומונס, יחד עם תמלולים שהיו קיימים עבורם מראש. הוא מכיל מעל 2,000 שעות שמע מתומללות בסך הכל. החלוקה הלשונית נוטה בכבדות לכיוון האנגלית, שתופסת לבדה 1,488 שעות, לצד שפות נוספות כמו גרמנית, הולנדית, ערבית, ספרדית, צרפתית, רוסית, קוריאנית ותאילנדית.

המבנה הפנימי מורכב מתיקיית אודיו, שתי תיקיות של תמלולים, וקובץ מיפוי שמקשר בין קובצי הקול לטקסטים שלהם. בנוסף לזיהוי דיבור רגיל, המאגר כולל 628 שעות של שמע שיש להן תרגומים במספר שפות במקביל, מה שמאפשר להשתמש בו גם למשימות תרגום דיבור ישיר.

מתאים ל

  • אימון זיהוי דיבור באנגלית

    אימון מודלי ASR על נאומים והקלטות שטח באנגלית בהיקף של קרוב ל־1,500 שעות.

  • תרגום ישיר מדיבור לטקסט

    פיתוח מודלים לתרגום דיבור מבוסס 628 שעות הקלטה עם תמלולים מקבילים במספר שפות.

  • בדיקת עמידות לאודיו היסטורי

    הערכת ביצועי מודלים על הקלטות ארכיון ישנות עם רעשי רקע אותנטיים ואיכות שמע משתנה.

איפה זה נופל

ההטיה הבולטת ביותר היא המקור עצמו, שכן התוכן מוגבל לחלוטין למה שמשתמשי ויקימדיה בחרו להעלות לאתר. מדובר בעיקר בנאומים פוליטיים, דיונים ממשלתיים, הקלטות היסטוריות וסיפורים מוקראים. אין כאן שיחות טבעיות יומיומיות. עברית כלל אינה מופיעה ברשימת השפות של המאגר. בנוסף, לא בוצע שום עיבוד ליישור זמנים מדויק או לחיתוך מקטעים, כך שהעבודה הקשה של סנכרון הטקסט לשמע נופלת עליכם.

שאלות
נפוצות

האם המאגר כולל עברית?

לא, עברית אינה נכללת ברשימת שפות התמלול של המאגר. הדאטהסט מתמקד בעיקר באנגלית, לצד שפות כמו גרמנית, ערבית, רוסית, ספרדית וצרפתית. אם אתם מחפשים לאמן מודלים לשפה העברית, תצטרכו לפנות למקורות אחרים.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר מופץ תחת רישיון CC BY-SA 4.0, שכולל דרישת שיתוף זהה. המשמעות היא שכל עבודה נגזרת או הפצה עלולה לחייב אתכם לפתוח את המודל תחת אותו רישיון חופשי. בנוסף, כל קובץ מקור מחזיק ברישיון משלו שמתועד בקובץ license.json, וחובה לוודא את תנאיו בנפרד.

האם קובצי השמע חתוכים ומיושרים למילים בתמלול?

לא, לא בוצע יישור כפוי או חיתוך למקטעים קצרים בעיבוד המאגר. הקבצים מגיעים באורכם המקורי כפי שנלקחו מויקימדיה קומונס לצד כתוביות SRT. מי שרוצה לאמן מודלים סטנדרטיים יצטרך לבצע פילוח וסנכרון זמנים באופן עצמאי.

איך נאספו הטקסטים וההקלטות?

כל המידע הורד ישירות מויקימדיה קומונס ללא יצירת תמלולים חדשים. הצוות סינן והוריד אך ורק קובצי וידאו שכבר הכילו תמלול קיים שהעלו המשתמשים. לאחר מכן קובצי הווידאו הומרו לשמע בפורמט FLAC בתדר 16 קילוהרץ.

איך טוענים

השמע מגיע כקובצי FLAC בתדר דגימה של 16 קילוהרץ, לאחר המרה מקובצי המקור באמצעות ffmpeg. התמלולים שמורים כקובצי כתוביות בפורמט SRT, ומחולקים לשתי תיקיות כדי לעקוף מגבלות קבצים טכניות. כדי לחבר בין הקול לטקסט, חובה לקרוא את קובץ המילון real_correspondence.json, שמכיל את שמות קובצי האודיו כמפתחות ואת רשימת קובצי התמלול המתאימים כערכים. אין צורך באישור גישה מיוחד כדי להוריד את 26,002 הקבצים.

from datasets import load_dataset

ds = load_dataset("MLCommons/speech-wikimedia")

הרישיון

המאגר עצמו מופץ ברישיון CC BY-SA 4.0, אך קובצי המקור מגיעים משילוב של נחלת הכלל ורישיונות קריאייטיב קומונס שונים. רישיון ה־ShareAlike מחייב שכל נגזרת שתפיצו תחתיו תהיה באותם תנאים, מה שמייצר סיכון ממשי למוצרים מסחריים סגורים. קובץ license.json מרכז את נתוני המקור והייחוס לכל קובץ, וחובה לבדוק אותו לפני שימוש.

הרישיון המלא ב־Hugging Face ↗