GPT
L

lj_speech

קוד פתוח

keithitounlicense2022-03-02

המאגר מרכז 13,100 קטעי שמע באנגלית של דוברת יחידה בהיקף של כמעט 24 שעות. הוא הפך לסטנדרט המרכזי לאימון מודלי הקראת טקסט בזכות התאמה קפדנית בין הקול למילים.

  • 1,207הורדות בחודש
  • 62לייקים

מה זה

הנתונים מכילים הקלטות שמע קצרות באורך שנע בין שניה לעשר שניות, שנלקחו מהקראת שבעה ספרי עיון שפורסמו במקור בין 1884 ל־1964. כל רשומה כוללת מזהה ייחודי, נתיב לקובץ, אובייקט שמע מפוענח, תמלול גולמי ותמלול מנורמל שבו מספרים, מטבעות וקיצורים הורחבו למילים שלמות.

קית' איטו יצר את המאגר על בסיס הקלטות פומביות של לינדה ג'ונסון מפרויקט ליבריווקס. החיתוך לקטעים בוצע אוטומטית לפי שתיקות, וההתאמה בין הטקסט לקול עברה בקרת איכות ידנית כדי לוודא דיוק מלא. אין במאגר חלוקה מובנית לסט אימון, בדיקה או ולידציה, והמשתמשים נדרשים לחלק אותו בעצמם.

מתאים ל

  • אימון מודלי הקראת טקסט

    אימון בסיסי של מודלי TTS בקול יחיד ובאיכות דיבור אחידה ונקייה באנגלית.

  • אימון זיהוי דיבור ממוקד

    פיתוח מודלי תמלול פשוטים שמתמקדים בהקראת ספרי שמע ובטקסטים ספרותיים.

  • מבחן ביצועים להקראה

    השוואת איכות קול ומדדי ציון דעת קהל מול לוחות המובילים הקיימים בתחום.

איפה זה נופל

ההקלטות שייכות לדוברת יחידה באנגלית בלבד, כך שאי אפשר לבנות בעזרתו מודלים שמזהים מגוון קולות או מבטאים שונים. חיתוך הקטעים נעשה לפי שתיקות ולכן גבולות האודיו לא תמיד חופפים לסופי משפטים. בנוסף, חומר המקור הגיע מקובצי MP3 דחוסים באיכות 128 קילו-ביט לשניה, מה שעלול להכניס רעשי רקע וארטיפקטים של דחיסה לצליל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. החומר נמצא בנחלת הכלל ופורסם תחת רישיון פתוח לחלוטין. מותר לאמן עליו מודלים מסחריים בלי לשלם תמלוגים ובלי חובת קרדיט.

האם יש במאגר תמיכה בעברית או במבטאים שונים?

לא. כל 24 שעות ההקלטה הן באנגלית בלבד, וכולן הוקלטו על ידי אותה דוברת אמריקאית. הוא לא מתאים לעבודה בעברית.

איך נאסף הטקסט והאם הוא תואם בדיוק לשמע?

הטקסט נלקח מספרי עיון היסטוריים והוקלט עבור פרויקט ליבריווקס. החוקרים עברו ידנית על ההקלטות והשוו אותן למילים כדי לוודא שאין טעויות תמלול.

האם הדאטהסט מחולק מראש לחלקי אימון ובדיקה?

לא. כל 13,100 הקטעים מגיעים בחבילה אחת. תצטרכו להגדיר בעצמכם את אחוזי החלוקה בין אימון למבחן בקוד לפני תחילת העבודה.

איך טוענים

טוענים את המאגר ישירות בספריית הדאטהסטס בלי צורך באישור גישה. קבצי הקול מגיעים בפורמט WAV מונו באיכות של 22050 הרץ ו־16 ביט. השדות החשובים לעבודה הם normalized_text שמכיל את הטקסט המורחב, ו־audio שמחזיר את מערך הדגימות. בגלל פענוח האודיו בזמן ריצה, כדאי לגשת קודם לאינדקס הרשומה ורק אז לשדה השמע כדי לא להעמיס על הזיכרון.

from datasets import load_dataset

ds = load_dataset("keithito/lj_speech")

הרישיון

המאגר שוחרר לנחלת הכלל תחת unlicense ורישיון ליבריווקס. מותר להשתמש בו לכל מטרה, כולל פיתוח מסחרי מלא, בלי חובת ייחוס ובלי דרישה לשתף את המודלים שתאמנו עליו באותו האופן.

הרישיון המלא ב־Hugging Face ↗