GPT
E

EuroSpeech

קוד פתוח

disco-ethother2025-05-10

המאגר מרכז הקלטות דיבור ממדינות אירופה לצד תמלולים ממוחשבים ואנושיים. הוא מתאים למי שבונה מודלי שמע רב-לשוניים וזקוק למדדי איכות מוכנים מראש ברמת המקטע.

  • 33,973הורדות בחודש
  • 100לייקים

מה זה

המאגר מחולק לפי מדינות, וכולל קובצי שמע בקצב דגימה של 16000 הרץ יחד עם מטא-דאטה מפורט. כל רשומה מייצגת קטע וידאו עם זמני התחלה וסיום מדויקים, משך בשניות, מזהה וידאו ומזהה תמלול. בנוסף, ישנו זיהוי של המדינה והשפה של כל קטע.

לצד ההקלטות תמצאו שני סוגי טקסט: תמלול מכונה ותמלול אנושי. המפרסמים חישבו עבור כל דגימה את מדדי השגיאה CER ו־WER, ושמרו את אינדקס המיקום של הקטע בתוך התמלול המקורי. החלוקה הפנימית מסודרת לתצורות נפרדות לפי מדינות, וברובן תמצאו סטים של אימון, בדיקה ואימות, אם כי ישנן מדינות מסוימות שבהן חסר סט אימון מלא.

מתאים ל

  • אימון מודלי זיהוי דיבור

    אימון והתאמה של מודלי שמע לשפות אירופאיות ספציפיות תוך שימוש בתמלול האנושי כבסיס.

  • הערכת ביצועי מודלים

    בדיקת איכות של מערכות זיהוי דיבור קיימות מול סטים מוכנים שכוללים חיתוך זמנים.

  • מחקר איכות תמלול

    ניתוח הפערים בין תמלול מכונה לתמלול אנושי בעזרת מדדי השגיאה המובנים בכל רשומה.

איפה זה נופל

ההטיה המשמעותית ביותר היא אי-אחידות מוחלטת בין המדינות. בסלובקיה, למשל, אין בכלל סט אימון אלא רק אימות ובדיקה, ובצרפת חסר סט אימות. מעבר לזה, המאגר מוגבל לשפות אירופאיות בלבד ואין בו עברית. איכות השמע וההקשרים התמטיים תלויים לחלוטין במקור הווידאו שממנו נגזרו הקטעים, ומכיוון שמדובר בתמלולים אוטומטיים לצד אנושיים, חייבים לבצע סינון ידני על המדדים לפני שמסתמכים על הטקסט לאימון.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

הרישיון המדווח מוגדר כאחר ולכן התנאים המסחריים אינם ידועים מתוך כרטיס המאגר. מומלץ לבדוק את פרסומי החוקרים של הפרויקט לפני שמשלבים את המידע בפיתוח מסחרי כלשהו.

כמה המאגר שוקל בפועל?

הנפח הכולל מגיע לטרבייטים רבים של נתונים, כאשר כל תצורת מדינה שוקלת בנפרד עשרות עד מאות ג'יגה-בייט. תצורת דנמרק לבדה, למשל, שוקלת מעל 600 ג'יגה-בייט להורדה.

האם יש במאגר נתונים בעברית?

לא, המאגר ממוקד כולו בשפות אירופאיות ספציפיות כמו אנגלית, גרמנית, צרפתית, נורווגית ואחרות. עברית אינה נכללת באף אחת מהתצורות.

מה מייחד את הדאטהסט הזה מאחרים?

כל דגימת קול כוללת מראש גם תמלול מכונה וגם תמלול אנושי, יחד עם חישוב מדדי שגיאה ברמת המילה והאות. זה חוסך שלב חישוב מורכב למי שרוצה לסנן דגימות רועשות לפי איכות.

איך טוענים

טוענים את המידע ישירות באמצעות ספריית הדאטהסטים הרגילה, תוך ציון שם המדינה הרצויה בתור תצורה. הקבצים שמורים בפורמט פרקט, ללא צורך בהרשאת גישה מיוחדת, אבל נפח הנתונים עצום ומגיע למאות ג׳יגה-בייט עבור מדינה בודדת. אם אתם עובדים על אימון, מומלץ להזרים את הנתונים ולא להוריד הכל מראש, ולסנן קטעים לפי עמודות השגיאה wer ו־cer לפני ההזנה למודל.

from datasets import load_dataset

ds = load_dataset("disco-eth/EuroSpeech")

הרישיון

הרישיון מוגדר כ־other, כלומר אין כאן רישיון קוד פתוח סטנדרטי ומוכר. אי אפשר לדעת מהכרטיס אם מותר להשתמש במידע למטרות מסחריות, מהן דרישות הייחוס, או אילו הגבלות חלות על מודל שתאמנו על הבסיס הזה. מבחינה משפטית, אסור לשלב את המאגר הזה במוצר מסחרי לפני שבודקים את תנאי המקור של החוקרים.

הרישיון המלא ב־Hugging Face ↗