GPT
A

AniSpeech

קוד פתוח

ShoukanLabsmit2023-12-24

  • anime
  • speech
  • text-to-speech
  • voice

המאגר מרכז הקלטות אודיו של קולות אנימה באנגלית יחד עם תמלול. הוא מתאים למי שבונה מודלי דיבור מרובי דוברים ומחפש מגוון רחב של אינטונציות וסגנונות משחק.

  • 556הורדות בחודש
  • 65לייקים

מה זה

הנתונים כוללים קטעי קול מתחום האנימה בליווי כיתובים, שנועדו לאימון מודלי טקסט לדיבור. כל דובר מקבל מזהה נפרד, והחומרים מחולקים לפי שפות כאשר הקבצים הזמינים הם באנגלית בלבד. היוצרים מציינים שהם מוסיפים דגימות באופן שוטף ככל שמתבצע תיוג נוסף.

הסינון לא נעשה באופן ידני מלא על כל פריט בגלל היקף המידע, אלא התבסס על הערכת איכות כללית. הכרטיס מציין שהמבנה המקורי התאים לפורמט של LJSpeech, אך בהמשך שונה כדי לשפר את איכות התמלולים, עם כוונה עתידית לספק סקריפטים להמרה חזרה.

מתאים ל

  • אימון מודל רב דוברים

    לימוד מודלי בסיס לטקסט לדיבור להתמודד עם מגוון אינטונציות וקולות שונים.

  • התאמת סגנון דיבור דרמטי

    כיול מודל קיים להפקת גווני קול ומשחק קולי מודגש באנגלית.

  • בדיקת חוסן תמלול

    הערכת עמידות של מודלי שמע מול טעויות תיוג וחלוקת דוברים משובשת.

איפה זה נופל

ההסתמכות על בדיקות איכות כלליות גורמת לחלוקת דוברים לא מדויקת, ולכן המאגר לא מתאים לאימון מודלים שמתמקדים בקול יחיד. תמלולים מסוימים עלולים להכיל שגיאות, ואיכות האודיו אינה אחידה לכל אורך הנתונים. המאגר מוגבל לאנגלית ואין בו נתונים בעברית.

שאלות
נפוצות

האם יש תמיכה בעברית?

לא. המאגר מכיל קולות ותמלולים בשפה האנגלית בלבד, ואין בו נתונים בעברית.

האם מותר להשתמש במאגר למטרות מסחריות?

המאגר מוגדר תחת רישיון MIT שמאפשר שימוש מסחרי. יש לוודא עמידה בתנאי הרישיון הבסיסיים כמו מתן קרדיט.

האם המאגר מתאים לבניית קול בודד?

לא מומלץ. היוצרים מציינים שהשיוך בין הדוברים אינו מדויק לגמרי, מה שמקשה על בידוד נקי של דובר ספציפי.

האם הקבצים תואמים לפורמט LJSpeech?

כרגע לא באופן טבעי. היוצרים שינו את המבנה כדי לשפר את הכיתובים, וטרם סיפקו סקריפט המרה רשמי לפורמט זה.

איך טוענים

הנתונים מחולקים למבנה של 39 קובצי parquet תחת תיקיית המידע באנגלית, לצד קובצי תיעוד ורישיון. הטעינה נעשית ישירות דרך ספריית הדאטהסטים באמצעות המזהה ShoukanLabs/AniSpeech, ללא צורך באישור גישה מוקדם או בהרשמה מיוחדת. השדות הרלוונטיים לעבודה הם מזהה הדובר, קובץ השמע והתמלול המצורף.

from datasets import load_dataset

ds = load_dataset("ShoukanLabs/AniSpeech")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש חופשי כולל שימוש מסחרי, שינוי והפצה מחדש, ואינו כופה שיתוף של מודלים שאומנו תחת אותו רישיון, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗