GPT
L

LoquaciousSet

קוד פתוח

speechbraincc-by-3.0,cc-by-4.02025-01-22

  • robust-speech-recognition
  • noisy-speech-recognition
  • speech-recognition

המאגר מרכז 25,000 שעות שמע מתומלל באנגלית ממקורות שונים, ומיועד למי שמחפש היקף גדול לאימון זיהוי דיבור ברישיונות פתוחים שמותרים גם לשימוש מסחרי.

  • 8,829הורדות בחודש
  • 63לייקים

מה זה

הרשומות מורכבות מקטעי שמע קצרים המוטמעים כבייטים יחד עם תמלול טקסט שעבר נירמול. הטקסט הוגבל ל־26 אותיות האלפבית האנגלי וגרש, מספרים הומרו למילים באמצעות הכלי של NeMo, וסימנים כמו מחיאות כפיים הוסרו.

התוכן נאסף מחמישה מקורות מוכרים: LibriHeavy, People's Speech, Yodas, Common Voice 18.0 ו־VoxPopuli. כדי לנקות את הנתונים, המפתחים השתמשו במודל זיהוי שפה על תכני Yodas שהגיעו מיוטיוב, סיננו דוברים עם יותר מ־9,000 דגימות ב־Common Voice, ולקחו מ־People's Speech רק את תת הקבוצה הנקייה.

המאגר מחולק לתצורות לפי גודל: large עם 25,000 שעות שכולל גם דיבור ספונטני ורועש, medium עם 2,500 שעות, small עם 250 שעות, ותת קבוצה clean עם 13,000 שעות שממנה הוצאו לחלוטין Yodas ו־People's Speech. הערכה מתבצעת על ספליטים ייעודיים של dev עם 15 שעות ו־test עם 21 שעות, הכוללים דגימות מאתגרות מ־Librispeech ותמלול ידני של Yodas.

מתאים ל

  • אימון מודלי ASR באנגלית

    אימון מודלים על היקף של עד 25,000 שעות שמע מגוונות, כולל דיבור ספונטני והקלטות עם רעשי רקע.

  • אימון ראשוני חסכוני

    בדיקת ארכיטקטורות או אימון מהיר על תצורות small או medium בלי להוריד טרה-בייטים שלמים של מידע.

  • בנייה והערכת מודלי שפה

    שימוש במודלי ה־n-gram ובמילון הפונטי שמצורפים למאגר לצורך שילוב בפענוח מודלי זיהוי דיבור.

איפה זה נופל

האיכות אינה אחידה בכל החלקים. בנתונים שנלקחו מ־Yodas ומ־People's Speech יש עדיין שגיאות תמלול מובנות, ולכן מי שצריך נתונים נקיים בלבד מוגבל לתת המאגר clean שמכיל רק כחצי מכמות השעות. בנוסף, הדאטהסט כולו באנגלית בלבד, ואין בו שום ייצוג לעברית. מקורות כמו יוטיוב מביאים איתם רעשי רקע ואיכויות הקלטה משתנות שלא תמיד יתאימו לכל מוצר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. כל חלקי המאגר נאספו ממקורות בעלי רישיונות פתוחים כמו CC0 ו־CC BY, והוא מופץ תחת CC BY 3.0 ו־CC BY 4.0. הדרישה העיקרית היא מתן קרדיט כנדרש ברישיון.

כמה מקום בדיסק צריך כדי לעבוד איתו?

הגרסה המלאה דורשת 4TB של שטח אחסון, מתוכם 2TB לקבצים הדחוסים ועוד 2TB לחילוץ שלהם. אם המשאבים מוגבלים, אפשר לטעון רק את גרסאות small או medium שדורשות משמעותית פחות נפח.

האם יש במאגר הקלטות בעברית?

לא. המאגר מוגדר ומכיל אך ורק שמע באנגלית. חלק מהסינון הפנימי כלל הסרה אקטיבית של שפות אחרות מתוך ההקלטות שנאספו.

מה ההבדל בין החלק שנקרא large לבין החלק שנקרא clean?

חלק ה־large כולל את כל 25,000 השעות, כולל הקלטות רועשות מתמלולים אוטומטיים של יוטיוב. חלק ה־clean מכיל 13,000 שעות בלבד, לאחר שהוצאו ממנו לחלוטין המקורות של People's Speech ו־Yodas כדי לשמור על איכות תמלול גבוהה יותר.

איך טוענים

הטעינה מתבצעת דרך datasets עם פונקציית load_dataset תוך בחירת החלק המבוקש, כמו small, medium או large. האודיו מאוחסן כבייטים גולמיים בשדה wav ודורש פענוח בזיכרון, למשל דרך torchaudio ו־BytesIO. החלק הגדול דורש נפח אחסון של 2TB לקבצי המקור ועוד 2TB לחילוץ, כך שצריך 4TB פנויים בדיסק כדי להריץ אותו. הגישה פתוחה ואינה דורשת אישור מראש.

from datasets import load_dataset

ds = load_dataset("speechbrain/LoquaciousSet")

הרישיון

המאגר מופץ תחת רישיונות CC BY 3.0 ו־CC BY 4.0. הרישיונות האלה מתירים שימוש מסחרי, שינוי והפצה, כל עוד מעניקים קרדיט מתאים ליוצרים המקוריים ומציינים את השינויים שנעשו. אין כאן דרישה של שיתוף זהה, כך שאין מניעה להשתמש בו לאימון מודלים פנימיים או מסחריים.

הרישיון המלא ב־Hugging Face ↗