GPT
L

libritts

קוד פתוח

mythicinfinitycc-by-4.02024-02-08

קורפוס של כמעט 585 שעות דיבור באנגלית מרובת דוברים באיכות של 24kHz. הוא מיועד למחקר ואימון של מודלי טקסט לדיבור, עם התאמה מלאה למבנה הנתונים של Hugging Face.

  • 6,754הורדות בחודש
  • 34לייקים

מה זה

המאגר כולל עשרות אלפי הקלטות אודיו של קריאת ספרים באנגלית, יחד עם טקסט מקורי ומנורמל, מזהי דוברים ומזהי פרקים. הנתונים נגזרו מהחומרים המקוריים של LibriSpeech, שכוללים קבצי שמע של פרויקט LibriVox וטקסטים מתוך פרויקט גוטנברג. העיבוד וההכנה נעשו על ידי הייגה זן בעזרת אנשי הצוותים של Google Speech ו־Google Brain, במטרה לספק משאב ייעודי למשימות דיבור.

החלוקה הפנימית מפרידה בין איכויות שונות ורמות רעש, ומכילה שבעה חלקים עיקריים: סטים נקיים לבדיקה ופיתוח, סטים נוספים תחת הגדרת other, ושלושה סטים לאימון לפי היקף שעות שכוללים 100 שעות נקיות, 360 שעות נקיות, ו־500 שעות של דיבור עם יותר רעש או שונות. בנוסף קיימות הגדרות מובנות לטעינה נוחה שמבודדות את החלקים הנקיים, חלקי ה־other, או סט הפיתוח בלבד לצורך בדיקות מהירות.

מתאים ל

  • אימון מודלי הקראת טקסט

    אימון מודלי דיבור באנגלית מרובת דוברים באיכות של 24kHz ישירות מקבצי הטקסט המנורמלים.

  • בדיקת איכות מערכות קול

    שימוש בסטים הנקיים והמופרדים של dev ו־test להערכת ביצועים והבנת הדיבור של מודלים קיימים.

  • אימון לעמידות ברעש

    שימוש בחלקי ה־other המכילים רעשי רקע והקלטות שונות כדי לחזק עמידות של מודלי שמע.

איפה זה נופל

המאגר מכיל אנגלית בלבד ומבוסס כולו על הקראת ספרים ישנים מתוך פרויקט גוטנברג. זה אומר שסגנון הדיבור הוא קריאה מונוטונית יחסית של ספרות, ולא שיחה טבעית או ספונטנית. חלקי ה־other כוללים איכויות הקלטה נמוכות יותר ורעשים, מה שמחייב סינון נוסף אם המטרה היא יצירת קולות מסחריים מלוטשים. בנוסף, אין במאגר שום ייצוג לשפות אחרות או לעברית, והאודיו הוקלט על ידי מתנדבים ביתיים באמצעי הקלטה שאינם אחידים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

כן, הרישיון הוא CC BY 4.0 ומאפשר שימוש מסחרי מלא. צריך רק לתת קרדיט למחברים המקוריים לפי תנאי הרישיון.

האם יש בו תמיכה בעברית?

לא, המאגר כולו מורכב מספרים מוקלטים בשפה האנגלית בלבד. אין בו שום דגימות קול או טקסטים בעברית.

מאיפה הגיעו הנתונים שנמצאים בפנים?

האודיו לקוח מהקלטות של פרויקט LibriVox והטקסטים מגיעים מפרויקט גוטנברג. הנתונים עובדו על ידי צוות בראשות הייגה זן בסיוע צוותי גוגל.

מה ההבדל העיקרי בין החלקים clean לבין other?

החלקים המוגדרים כ־clean כוללים הקלטות ברורות יותר עם פחות רעשי רקע ואיכות קול אחידה יחסית. חלקי ה־other מכילים הקלטות ברמת איכות נמוכה יותר או תנאי שמע מאתגרים.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה datasets באמצעות המזהה mythicinfinity/libritts. אין צורך לבקש אישור גישה מוקדם, והקבצים מחולקים למאות קבצי Parquet. אפשר לבחור קונפיגורציה ספציפית כמו clean או dev כדי לא להוריד את כל המאגר בבת אחת, ויש תמיכה מלאה בהזרמה (streaming). השדות המרכזיים בכל רשומה הם audio שמוגדר מראש לקצב דגימה של 24,000Hz, הטקסט המנורמל והמקורי, ומזהי הדובר והפרק.

from datasets import load_dataset

ds = load_dataset("mythicinfinity/libritts")

הרישיון

הרישיון הוא CC BY 4.0. מותר להשתמש בנתונים לכל מטרה, כולל שימוש מסחרי ואימון מודלים, ומותר לשנות או להפיץ אותם הלאה. התנאי היחיד הוא מתן קרדיט הולם ליוצרים המקוריים, ואין חובה לשתף את המודל או את הנגזרות תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗