GPT
M

multilingual_librispeech

קוד פתוח

facebookcc-by-4.02022-03-02

עשרות אלפי שעות של הקראת ספרים בשמונה שפות אירופיות. מאגר עצום שמתאים למי שרוצה לאמן או לבחון מודלים של זיהוי דיבור על נתונים נקיים יחסית.

  • 23,946הורדות בחודש
  • 189לייקים

מה זה

המאגר כולל קטעי אודיו של ספרי שמע ממיזם LibriVox לצד התמלול שלהם. כל רשומה כוללת קובץ אודיו בפורמט flac בקצב דגימה של 16000 הרץ, טקסט מתומלל, מזהה דובר ומזהה פרק בספר. האוסף מכיל מעל 44,500 שעות באנגלית וכ־6,000 שעות נוספות המחולקות בין שבע שפות אירופיות: גרמנית, הולנדית, צרפתית, ספרדית, איטלקית, פורטוגזית ופולנית.

החלוקה הפנימית מציעה סטים של אימון, פיתוח ומבחן לכל שפה, כולל תתי קבוצות מוגדרות של שעה אחת ותשע שעות לצורך בדיקות מהירות. בעוד שבאנגלית ישנם אלפי דוברים, בשפות האחרות המגוון קטן משמעותית. לדוגמה, בפולנית יש בסך הכל 11 דוברים בסט האימון ובהולנדית 40, מה שמייצר ריכוזיות סביב קולות בודדים.

מתאים ל

  • זיהוי דיבור רב לשוני

    אימון ובדיקת מודלי תמלול על שמונה שפות מערביות בסביבה אקוסטית נקייה.

  • המרת טקסט לדיבור

    יצירת קולות סינתטיים והקראת טקסטים בהתבסס על שעות רבות של אותו דובר.

  • זיהוי דוברים

    הפרדה וסיווג לפי קול באמצעות מזהי הדובר הייחודיים הקיימים ברשומות.

איפה זה נופל

ההטיה המשמעותית ביותר היא אופי הדיבור: מדובר בהקראת ספרי שמע ולא בשיחה טבעית, ספונטנית או רועשת. אם אתם בונים מוצר שצריך לתמלל שיחות טלפון או פגישות, המודל יתקשה מאוד. בנוסף, חלוקת השפות מעוותת לחלוטין לטובת אנגלית, ובשפות הקטנות כמו פולנית או איטלקית מספר הדוברים כה נמוך עד שקיים סיכון ממשי לשינון מאפייני קול במקום למידת שפה. המאגר אינו מכיל עברית כלל, וכרטיס המידע מזהיר במפורש שאסור לנסות לחשוף את זהות הדוברים שהתנדבו להקליט.

שאלות
נפוצות

האם המאגר כולל תמיכה בעברית?

לא. המאגר מכיל שמונה שפות בלבד: אנגלית, גרמנית, הולנדית, צרפתית, ספרדית, איטלקית, פורטוגזית ופולנית. אין בו שום ייצוג לעברית.

האם מותר להשתמש בו לאימון מוצר מסחרי?

כן, רישיון cc-by-4.0 מתיר שימוש מסחרי מלא. עליכם רק לציין ייחוס מתאים לחוקרים שפרסמו את הדאטהסט.

האם חייבים להוריד את כל הקבצים כדי להתחיל לעבוד?

ממש לא. אפשר לטעון קונפיגורציה של שפה בודדת ולהשתמש בהזרמה ישירה בקוד, מה שחוסך הורדה של עשרות אלפי שעות שמע לדיסק המקומי.

האם המאגר מתאים לזיהוי דיבור של שיחות שירות או פגישות?

לא מומלץ להסתמך רק עליו. ההקלטות מגיעות מספרי שמע מוקפדים וברורים, ללא רעשי רקע, קטיעות או שפה מדוברת יומיומית.

איך טוענים

טוענים את הנתונים דרך ספריית datasets לפי שפה ספציפית, למשל ציון german כפרמטר. בגלל נפח האודיו הכולל, מומלץ להפעיל את מצב הזרמת הנתונים במקום להוריד מראש מאות ג'יגה בייטים לדיסק. הגישה חופשית ואינה דורשת אישור, אך יש לגשת תחילה לאינדקס הדגימה ורק לאחר מכן לשדה האודיו כדי למנוע פענוח כבד של כל הקבצים בזיכרון.

from datasets import load_dataset

ds = load_dataset("facebook/multilingual_librispeech")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0 לצד הגדרת נחלת הכלל של ספרי המקור. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ומאפשר לאמן עליו מודלים מסחריים בלי חובה לשתף את המודל תחת אותו רישיון. התנאי המרכזי שחובה לקיים הוא מתן קרדיט וייחוס הולם ליוצרי המאגר.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗