GPT
V

voxpopuli

קוד פתוח

facebookcc0-1.0,other2022-05-10

הקלטות דיבור פוליטי מפרלמנט האיחוד האירופי עם תמלול בשפות אירופיות שונות. המאגר מציע שעות רבות של דיבור אמיתי, כולל אנגלית במבטאים זרים, לטובת אימון מודלי זיהוי דיבור.

  • 83,609הורדות בחודש
  • 162לייקים

מה זה

הנתונים מורכבים מהקלטות קוליות של אירועים רשמיים בפרלמנט האירופי שנאספו בין השנים 2009 לבין 2020. חומר הגלם נלקח ישירות ממאגר המולטימדיה של הפרלמנט, ועבר עיבוד ותמלול. המאגר כולל דיבור מתומלל עבור שפות אירופיות, ביניהן אנגלית, גרמנית, צרפתית, ספרדית, פולנית, הולנדית ועוד.

חלק מיוחד מוקדש לאנגלית שמדוברת בפי נואמים שאינם דוברים ילידיים. חלק זה כולל 29 שעות מתומללות שמכסות 15 מבטאים שונים, ומיועד לבדיקה ואימון של מערכות זיהוי דיבור על מבטאים לא שגרתיים. החלוקה הפנימית מסודרת לפי שפות, ובכל שפה קיימים פיצולים לקבוצות אימון, תיקוף ומבחן בפורמט קובצי נתונים מסודרים.

מתאים ל

  • אימון זיהוי דיבור רב לשוני

    פיתוח מודלי תמלול אוטומטי לשפות אירופיות מרכזיות על בסיס שעות רבות של דיבור מתועד.

  • התמודדות עם מבטאים באנגלית

    אימון ובדיקה של מודלים מול דוברי אנגלית שאינם שפת אם עם 15 מבטאים שונים.

  • הערכת ביצועי מודלי שמע

    שימוש בפיצולי המבחן להשוואת דיוק של מנועי תמלול שונים על שפה מדוברת רשמית.

איפה זה נופל

הדיבור מגיע כולו מנאומים רשמיים ומדיונים בפרלמנט האירופי, כך שמדובר בשפה פורמלית מאוד, בקצב מסוים ועם אוצר מילים פוליטי ומשפטי. אם המוצר שלכם מיועד לשיחות יומיומיות, שיחות טלפון או סלנג, המודל יתקשה. עברית לא קיימת כאן כלל, והטווח מוגבל אך ורק לשפות של האיחוד האירופי שנאספו עד שנת 2020.

שאלות
נפוצות

האם הדאטהסט כולל הקלטות בעברית?

לא, אין במאגר עברית כלל. כל ההקלטות נאספו מדיוני הפרלמנט האירופי, ולכן הן כוללות רק שפות אירופיות רשמיות. אם אתם מחפשים לאמן מודלים לעברית, תצטרכו לחפש מקורות נתונים אחרים לחלוטין.

האם מותר להשתמש במידע לפיתוח מסחרי?

הרישיון הרשום מציין שילוב של נחלת הכלל cc0 יחד עם תנאים נוספים של הפרלמנט האירופי. החומרים פתוחים לשימוש ומחקר, אך בגלל התיוג הנוסף מומלץ לבדוק את תנאי המקור של האיחוד לפני הפצה מסחרית. מודלים שאומנו על הנתונים עשויים לדרוש התייחסות לתנאי השימוש של חומרי המקור.

מאיזה סוג של תוכן ההקלטות מורכבות?

מדובר בהקלטות מתוך אירועים, דיונים ונאומים רשמיים בפרלמנט האירופי בין השנים 2009 לבין 2020. האודיו באיכות של שידור ציבורי ממוסד, אבל הדוברים מגיעים מרקעים שונים ומדברים לרוב שפה רשמית. אין כאן שיחות רחוב, רעשי רקע ביתיים או דיאלוגים חופשיים.

איך טוענים

טוענים את המאגר באמצעות ספריית datasets הרגילה, כאשר מעבירים את קוד השפה המבוקשת בתור תצורה, למשל hr עבור קרואטית, או multilang כדי לטעון את כל השפות יחד. המאגר כולל 245 קבצים בפורמט parquet, ואין צורך בבקשת אישור מיוחדת כדי לגשת אליהם או להוריד אותם ישירות מהרשת.

from datasets import load_dataset

ds = load_dataset("facebook/voxpopuli")

הרישיון

הרישיון המדווח משלב בין cc0-1.0 לבין הגדרת other, ומבוסס על תנאי השימוש של חומרי הפרלמנט האירופי. בעוד cc0 מאפשר שימוש חופשי לגמרי כולל מסחרי, ההגדרה הנוספת דורשת בדיקה זהירה של מקור הנתונים המקורי לפני שילוב המודל במוצר מסחרי סגור.

הרישיון המלא ב־Hugging Face ↗