GPT
L

libritts_r_filtered

קוד פתוח

parler-ttscc-by-4.02024-06-13

גרסה מסוננת ומנוקה של מאגר LibriTTS-R, שמכילה דיבור באנגלית ברוחב פס של 24kHz. המאגר מיועד למי שבונה מודלי דיבור ולא רוצה לבזבז זמן אימון על שמע מקולקל או דוברים מעורבבים.

  • 3,251הורדות בחודש
  • 24לייקים

מה זה

המאגר מבוסס על LibriTTS-R, שהוא בעצמו שחזור ושיפור איכות של מאגר LibriTTS המקורי מ־2019, הכולל כ־585 שעות הקלטה של ספרי שמע באנגלית. ברשומות תמצאו קבצי אודיו לצד טקסט מקורי, טקסט מנורמל, מזהה דובר, מזהה פרק ונתיב קובץ.

הסינון כאן התבצע לפי שני מקורות עיקריים. מצד אחד הוסרו קטעים שבהם אלגוריתם שיקום השמע של LibriTTS-R נכשל לפי המאמר המקורי שלו. מצד שני נופו דוברים מתוך רשימת ההחרגה של LibriTTS-P, שזיהתה מקרים שבהם מספר דוברים שונים תויגו בטעות תחת אותו מזהה.

הנתונים מחולקים לשבעה חלקים מוכרים, ביניהם חלוקות אימון לפי רמת רעש ושעות כמו train.clean.100, train.clean.360 ו־train.other.500, לצד חלקי dev ו־test מקבילים.

מתאים ל

  • אימון מודלי הקראה

    אימון מודלי text-to-speech באיכות דגימה של 24kHz על גבי קולות מרובים של דוברי אנגלית.

  • בדיקת זיהוי דיבור

    הערכת ביצועים של מודלי ASR על טקסט מנורמל ודיבור נקי מהפרעות.

  • אימון מקודדי שמע

    פיתוח מודלים לדחיסה או סינתזה של שמע ללא נפילה על דגימות פגומות.

איפה זה נופל

המאגר כולו מבוסס על אנגלית בלבד, ואין בו שום ייצוג לעברית או למבטאים מקומיים. מעבר לכך, מקור השמע הוא הקראת ספרי שמע ישנים, כך שהאינטונציה דרמטית ומאופקת יחסית ואינה מייצגת שיחה טבעית או ספונטנית. אם אתם בונים מערכת לזיהוי דיבור יומיומי או מודל הקראה לשירות לקוחות, הנתונים האלה לא יספיקו לבדם ותצטרכו לבדוק את עמידות המודל לרעשי רקע שאינם קיימים בהקלטות אולפן ביתיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא CC BY 4.0 שמתיר שימוש מסחרי מלא. עליכם רק לציין את הקרדיט ליוצרי המאגר כנדרש ברישיון. המודלים שאימנתם על גביו אינם מחויבים ברישיון פתוח.

האם יש במאגר דגימות בעברית?

לא, המאגר כולל אך ורק דיבור בשפה האנגלית. כל הטקסטים וההקלטות לקוחים מספרי שמע באנגלית. לפרויקטים בעברית תצטרכו לחפש מקורות נתונים אחרים לחלוטין.

מה ההבדל בין מאגר זה ל־LibriTTS המקורי?

המאגר המקורי כלל הקלטות מ־LibriSpeech באיכות משתנה ולעיתים עם רעשי רקע. גרסת LibriTTS-R עברה שיקום סאונד ממוחשב, והגרסה הזו מסירה באופן ספציפי קטעים שבהם השיקום נכשל וכן דוברים שזוהו בטעות כישות אחת.

איך בוחרים להוריד רק חלק מהנתונים לבדיקה?

אפשר להעביר לפונקציית הטעינה את הקונפיגורציה dev כדי לקבל רק את הפיצול dev.clean. אפשרות נוספת היא להפעיל את הדגל streaming כדי להזרים דגימות בודדות ישירות מהרשת. כך נמנעת הורדה של עשרות ג'יגה-בייט למחשב המקומי.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות load_dataset, ללא צורך באישור גישה מיוחד. הקבצים נשמרים בפורמט Parquet, ומאחר שמדובר ב־199 קבצים הכוללים אודיו מלא, אפשר וכדאי לעבוד במצב streaming אם רוצים לחסוך מקום בדיסק המקומי. בקריאה לפונקציה ניתן לבחור קונפיגורציות ספציפיות כמו dev לבדיקה מהירה, clean לקבלת החלקים הנקיים בלבד, או other.

from datasets import load_dataset

ds = load_dataset("parler-tts/libritts_r_filtered")

הרישיון

המאגר מופץ תחת רישיון CC BY 4.0, שמאפשר שימוש חופשי כולל שימוש מסחרי, שינוי והפצה מחדש. התנאי היחיד הוא מתן קרדיט מתאים למחברים המקוריים של המאגר. מודלים שתאמנו על הדאטהסט הזה יכולים לשמש במוצרים מסחריים בלי חובה לחשוף את קוד המקור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗