GPT
M

mls_eng

קוד פתוח

parler-ttscc-by-4.02024-03-11

אלפי שעות של הקראת ספרי שמע באנגלית, מאורגנות להזרמה ישירה בלי להוריד עשרות גיגבייטים מראש. המאגר מתאים לאימון מודלי זיהוי דיבור ויצירת קול באנגלית בהיקף רחב.

  • 5,796הורדות בחודש
  • 39לייקים

מה זה

המאגר מכיל קטעי אודיו קצרים בפורמט FLAC בליווי תמלול טקסטואלי מלא, מזהה דובר, ומזהה פרק. ההקלטות נלקחו מפרויקט LibriVox, שבו מתנדבים מקריאים ספרים מתוך נחלת הכלל, ונארזו מחדש על ידי parler-tts מתוך גרסת המקור של OpenSLR כדי לאפשר עבודה רציפה בהזרמה.

הנתונים מחולקים לשלושה חלקים עיקריים: אימון, בדיקה ופיתוח. חלק האימון כולל 44,659.74 שעות עם 2,742 דוברים ו־2,748 דוברות. חלק הפיתוח מכיל 15.75 שעות וחלק הבדיקה מכיל 15.55 שעות, כאשר בשניהם יש בדיוק 21 גברים ו־21 נשים עם חלוקת שעות שווה כמעט לחלוטין בין המינים.

מתאים ל

  • אימון זיהוי דיבור

    אימון מודלי ASR על עשרות אלפי שעות דיבור באנגלית עם מגוון קולות רחב.

  • יצירת קול מטקסט

    אימון מודלי TTS והפקת אודיו בעזרת חלוקה לפי מזהה דובר מוגדר.

  • זיהוי דוברים

    בניית מודלים לסיווג ואימות קול לפי אלפי הדוברים המתועדים במאגר.

איפה זה נופל

כל ההקלטות מבוססות על הקראת ספרי שמע ישנים על ידי מתנדבים, כך שהשפה ספרותית מאוד ורחוקה משיחה יומיומית, סלנג או דיבור ספונטני. איכות ההקלטה משתנה מדובר לדובר בהתאם לציוד הביתי שבו השתמש. בנוסף, המאגר כולל אנגלית בלבד, ופרטי תהליך הסינון והנרמול המדויקים לא מפורטים בכרטיס. תנאי השימוש אוסרים במפורש לנסות לזהות את האנשים שתרמו את קולם.

אותה משפחה

mls-eng יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר הזה מכיל אך ורק הקלטות באנגלית. המאגר המקורי כולל שפות אירופיות נוספות, אך עברית אינה חלק מהן כלל.

האם מותר להשתמש בו לאימון מוצר מסחרי?

כן, רישיון CC-BY-4.0 מאפשר שימוש מסחרי מלא כולל אימון מודלים. החובה העיקרית היא מתן קרדיט כנדרש ברישיון, לצד האיסור לנסות לחשוף את זהות המתנדבים שהקליטו.

מה ההבדל בינו לבין הגרסה המקורית של OpenSLR?

התוכן זהה לחלק האנגלי של Multilingual LibriSpeech, אך הקבצים נארזו מחדש בפורמט Parquet. המבנה הזה נבנה במיוחד כדי לאפשר טעינה בהזרמה ישירה בלי להוריד את כל נפח הענק מראש.

איך טוענים

טוענים את המאגר ישירות בספריית datasets עם השם parler-tts/mls_eng. אין צורך באישור גישה מוקדם. המאגר מורכב מ־1,420 קובצי Parquet שונים, כאשר רק שלב האימון מפוצל ל־1,417 קבצים שונים, כך שמומלץ להשתמש בפרמטר streaming כדי להימנע מהורדת עשרות אלפי שעות לדיסק המקומי. השדות החשובים לעבודה הם audio שמחזיר מערך מפוענח וקצב דגימה, ו־text שמכיל את התמלול.

from datasets import load_dataset

ds = load_dataset("parler-tts/mls_eng")

הרישיון

הרישיון המדווח הוא CC-BY-4.0 בשילוב חומרים מנחלת הכלל. מותר להשתמש בנתונים למטרות מסחריות ומחקריות, לשנות אותם ולאמן עליהם מודלים, בתנאי שנותנים ייחוס מתאים למקור. אין חובה לשתף את המודל או את הנגזרות תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗