GPT
C

cml-tts

קוד פתוח

ylacombecc-by-4.02023-11-23

הקלטות שמע מספרי אודיו בשבע שפות אירופיות בקצב דגימה של 24kHz. החומר מיועד לבניית מודלי דיבור באיכות אחידה לשפות שאינן אנגלית.

  • 54,912הורדות בחודש
  • 35לייקים

מה זה

המאגר מכיל קטעי קול מוקלטים של מתנדבים ממיזם LibriVox שמקריאים ספרים מנחלת הכלל של פרויקט גוטנברג. הקבצים סודרו מחדש מתוך מאגר הדיבור הרב-לשוני של OpenSLR כדי להתאים להזרמה ישירה. כל דגימה מכילה את נתיב הקובץ, מערך האודיו המפוענח, קצב הדגימה, התמלול המקורי ומזהה דובר ייחודי.

לצורך סינון וטיוב החומר, החוקרים חישבו תמלול אוטומטי בעזרת מודל wav2vec והוסיפו לכל רשומה את מרחק לוינשטיין בינו לבין הטקסט המקורי. בנוסף מופיעים משך הזמן בשניות, כמות המילים וגודל קובץ הקול.

הנתונים מחולקים לפי שבע שפות: הולנדית, גרמנית, צרפתית, איטלקית, פולנית, פורטוגזית וספרדית. עבור כל שפה קיימת חלוקה מובנית לסט אימון, סט פיתוח וסט בדיקה, כאשר סך שעות האימון עומד על 3,176.13 שעות.

מתאים ל

  • אימון מודלי הקראת טקסט

    בניית מודלי דיבור באיכות 24kHz לשפות אירופיות כמו גרמנית, ספרדית וצרפתית על סמך טקסט מיושר לקול.

  • סינון קול לפי דובר

    אימון מודלים מרובי דוברים באמצעות שימוש במזהה speaker_id הקיים בכל רשומה.

  • בדיקת דיוק תמלול

    הערכת מודלי דיבור לאודיו בעזרת ציון מרחק לוינשטיין המצורף לכל דגימה במאגר.

איפה זה נופל

ההקלטות מבוססות על ספרי אודיו ישנים שמקורם בטקסטים מנחלת הכלל, כך שהשפה כתובה וספרותית ולא משקפת דיבור יומיומי טבעי. איכות ההקלטה וסביבת האקוסטיקה משתנות בין הדוברים כי מדובר במתנדבים שהקליטו בציוד ביתי. עברית אינה קיימת במאגר כלל, והוא מוגבל לשבע השפות האירופיות שצוינו.

קיים גם חוסר איזון ניכר בכמויות. בגרמנית יש 608296 דוגמאות אימון ו־168 דוברים, בעוד שבפולנית יש 18719 דוגמאות ו־8 דוברים בלבד. בנוסף, חל איסור מפורש לנסות לזהות את האנשים שתרמו את קולם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא cc-by-4.0 ומאפשר שימוש מסחרי מלא, כולל אימון מודלים סגורים. הדרישה היחידה היא מתן קרדיט נאות ליוצרי המאגר.

האם המאגר כולל עברית?

לא. המאגר מוגבל לשבע שפות בלבד: הולנדית, צרפתית, גרמנית, איטלקית, פולנית, פורטוגזית וספרדית.

מאיפה הגיעו קובצי הקול והטקסט?

הטקסטים מגיעים מספרים בנחלת הכלל של פרויקט גוטנברג. ההקלטות בוצעו על ידי מתנדבים של פרויקט LibriVox ועובדו מתוך מאגר OpenSLR.

האם צריך להוריד את כל הקבצים מראש כדי להתחיל לעבוד?

לא. אפשר לטעון שפה מסוימת ישירות דרך ספריית datasets עם פרמטר של הזרמה. זה מאפשר לעבד דגימות ברצף בלי לשמור את כל קובצי ה־parquet בדיסק המקומי.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות ציון שם השפה הרצויה, למשל german, ובחירת החלוקה. אין צורך בבקשת גישה מיוחדת, והמאגר פתוח להורדה ישירה. אפשר להפעיל הזרמה כדי לעבוד עם דגימה בודדת בכל פעם בלי להוריד את כל קובצי ה־parquet למחשב.

השדות החשובים לשימוש הם audio שמכיל את האות המפוענח, text של התמלול ו־speaker_id. בגישה לנתונים חשוב לפנות קודם לאינדקס הדגימה ורק אז לשדה השמע, כדי למנוע פענוח ושינוי קצב דגימה מיותר של קבצים רבים בבת אחת.

from datasets import load_dataset

ds = load_dataset("ylacombe/cml-tts")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שניתן קרדיט מתאים ליוצרים ומצוין קישור לרישיון. אין חובה לשתף מודלים או יצירות נגזרות תחת אותו הרישיון, מה שמאפשר לאמן מודלים למוצרים מסחריים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗