GPT
L

libritts_r

קוד פתוח

mythicinfinitycc-by-4.02024-02-03

גרסה משופרת של קורפוס הדיבור הפופולרי באנגלית, שמספקת כ־585 שעות הקלטה בתדר 24kHz. היא פותרת בעיות איכות צליל ומתאימה במיוחד לאימון מודלי הקראת טקסט מרובי דוברים.

  • 12,112הורדות בחודש
  • 48לייקים

מה זה

המאגר מבוסס על קורפוס LibriTTS המקורי מ־2019, שמכיל הקראות של ספרי שמע באנגלית מפי דוברים מרובים, אך עבר תהליך שחזור ושיפור איכות שמע. ההקלטות מגיעות בתדר דגימה של 24kHz, וכל רשומה כוללת את קובץ האודיו, טקסט מקורי לצד טקסט שעבר נורמליזציה, מזהה דובר ייחודי, מזהה פרק ומזהה רשומה.

הנתונים מחולקים לשבעה חלקים עיקריים שמאפשרים הפרדה ברורה בין אימון לבדיקה. ישנם חלקי אימון לפי רמת רעש והיקף, כמו חלקי clean של 100 ו־360 שעות, לצד חלק other שמכיל כ־500 שעות עם תנאי הקלטה מאתגרים יותר. באותו אופן קיימות חלוקות של dev ו־test לרמות נקיות ולרמות מעורבות, כדי שתוכלו לבחון את המודל על נתונים סטריליים או מורכבים.

מתאים ל

  • אימון מודלי הקראת טקסט

    בניית מודלי TTS מרובי דוברים באיכות גבוהה על גבי מאות שעות שמע נקיות באנגלית.

  • הערכת עמידות לרעש

    מבחן ביצועים למודלי שמע על גבי חלוקות ה־other כדי לבדוק התמודדות עם סביבות הקלטה פחות אופטימליות.

  • שחזור ושיפור איכות קול

    אימון מודלים להסרת רעשים ושיפור אות שמע תוך שימוש בהקלטות המשוחזרות כמטרות איכות.

איפה זה נופל

ההקלטות כולן באנגלית בלבד ומבוססות על הקראת ספרי אודיו, כך שסגנון הדיבור ספרותי, מוקפד ורחוק מאוד משיחה טבעית או יומיומית. אין כאן מילה בעברית, ולכן הוא לא יעזור כלל למי שבונה מודלים מקומיים. בנוסף, חלקי ה־other עדיין כוללים רעשי רקע ופגמים אקוסטיים למרות השיקום, וחובה לבחון את התאמת הטקסט המנורמל לפני שדוחפים אותו לאימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא CC-BY 4.0, שמאפשר שימוש מסחרי מלא ללא הגבלה על תוצרי המודלים. החובה היחידה שלכם היא לתת ייחוס הולם למפרסמי המאגר.

האם המאגר כולל נתונים בעברית?

לא. המאגר מכיל הקלטות בשפה האנגלית בלבד, שמקורן בספרי שמע ציבוריים.

מה ההבדל בין מאגר זה ל־LibriTTS המקורי?

מאגר זה, LibriTTS-R, הוא גרסה מעודכנת שבה אותות השמע עברו תהליכי שחזור ושיפור איכות צליל דיגיטליים. המבנה הבסיסי והחלוקות נשמרו, אך איכות האודיו עצמה טובה יותר.

האם חייבים להוריד את כל 585 השעות כדי להתחיל?

לא. המאגר תומך בקונפיגורציות שונות, כך שאפשר להוריד רק את חלק ה־dev לבדיקה מהירה, או להשתמש בהזרמה ישירה בלי להוריד את הקבצים לכונן.

איך טוענים

טוענים אותו ישירות דרך ספריית datasets באמצעות פקודת load_dataset רגילה בפורמט Parquet, ללא צורך באישור גישה מיוחד. המאגר מאורגן ב־198 קבצים ומציע קונפיגורציות שונות: ברירת המחדל מורידה הכל, אך אפשר להגדיר clean כדי להוריד רק את ההקלטות הנקיות, dev לבדיקה מהירה, או להפעיל מצב streaming כדי להתחיל לעבוד בלי להוריד מאות שעות שמע מראש למחשב.

from datasets import load_dataset

ds = load_dataset("mythicinfinity/libritts_r")

הרישיון

המאגר מופץ תחת רישיון CC-BY 4.0. הרישיון מתיר שימוש חופשי, כולל שימוש מסחרי, שינוי והפצה של הנתונים והמודלים שמאומנים עליהם, בתנאי אחד פשוט: מתן קרדיט וייחוס הולם ליוצרי המאגר המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗