GPT
Y

yodas2_sidon

קוד פתוח

sarulab-speechcc-by-3.02025-11-13

  • speech
  • synthetic
  • youtube
  • yodas

מאגר קול רב-לשוני עצום מיוטיוב שעבר ניקוי ושיקום רעשים ייעודי. הוא נבנה כדי לאפשר אימון מודלים של יצירת דיבור בלי רעשי הרקע של המקור.

  • 33,122הורדות בחודש
  • 65לייקים

מה זה

הנתונים מבוססים על מאגר YODAS-2, שמקורו בסרטוני יוטיוב במגוון שפות, כולל ערבית, אפריקאנס ובולגרית. היוצרים העבירו את כל קטעי השמע דרך מודל השיקום Sidon כדי לסנן רעשי רקע ולשפר את בהירות הדיבור, ולאחר מכן דגמו את האודיו מחדש לתדר של 24 קילו-הרץ בגלל מגבלות אחסון.

כל רשומה במאגר מורכבת מקובץ אודיו בפורמט FLAC בערוץ בודד, ולצדו קובץ מטא-דאטה אופציונלי. קובץ המידע כולל תמלול של הקטע, מזהה הסרטון המקורי ביוטיוב ואת שפת הדיבור. המאגר כולו מחולק לאלפי קובצי ארכיון לפי שפות ותתי-קבוצות.

מתאים ל

  • אימון סינתזת דיבור

    אימון מודלי TTS בשפות נתמכות שדורשים אודיו נקי מרעשי רקע בתדר 24kHz.

  • מודלי שפה קוליים

    בניית מודלי Spoken Language שמפיקים או מבינים דיבור רציף ומסונן בקנה מידה גדול.

  • אימון זיהוי דיבור

    שימוש בקטעים המלווים בתמלול מתוך המטא-דאטה לצורך מודלי ASR רב-לשוניים.

איפה זה נופל

ההסתמכות על יוטיוב גוררת הטיות מובנות בסוגי הדוברים, איכות ההקלטה המקורית ותחומי השיחה. שנית, קובץ המטא-דאטה מוגדר כאופציונלי, מה שאומר שלא לכל קובץ שמע יש תמלול או מזהה סרטון זמינים. בנוסף, עברית אינה מופיעה ברשימת השפות המדווחות במאגר, ואלגוריתם שיקום השמע עלול להכניס ארטיפקטים מלאכותיים לקול המעובד, בייחוד לאחר ההורדה ל־24 קילו-הרץ.

שאלות
נפוצות

האם המאגר מתאים לפרויקטים בעברית?

לא. רשימת השפות שפורסמה כוללת שפות כמו ערבית, אפריקאנס ובולגרית, אך עברית אינה נכללת בהן.

האם מותר להשתמש בנתונים לאימון מודל מסחרי?

כן, הרישיון הוא CC-BY-3.0 שמאפשר שימוש מסחרי. חובת השימוש היחידה היא מתן קרדיט ברור למחברים בהתאם לתנאי הרישיון.

מה ההבדל בין מאגר זה ל־YODAS-2 המקורי?

המאגר המקורי הכיל אודיו ישיר מיוטיוב עם רעשי רקע סביבתיים מגוונים. הגרסה הזו עברה סינון ושיקום דיבור באמצעות מודל Sidon והורדת דגימה ל־24 קילו-הרץ כדי להתאים ליצירת דיבור נקייה.

האם חובה להוריד את כל המאגר כדי להתחיל לעבוד?

ממש לא, וגם לא מומלץ בהתחשב בהיקף של מעל 11,000 קבצים. הנתונים בנויים בפורמט WebDataset שמיועד להזרמה ישירה בקוד לפי שפה ותת-קבוצה ספציפית.

איך טוענים

המאגר שמור בפורמט WebDataset כקבצי tar.gz וכולל מעל 11,000 קבצים ומאות מיליוני רשומות, כך שהורדה מלאה לדיסק המקומי אינה מעשית לרוב המשתמשים. הגישה אליו פתוחה ואינה דורשת אישור מיוחד. הדרך הנכונה לעבוד איתו היא באמצעות הזרמה דרך ספריית datasets עם תמיכה ב־webdataset, תוך סינון לפי תת-הקבוצה והשפה הרלוונטיות לקוד שלכם.

from datasets import load_dataset

ds = load_dataset("sarulab-speech/yodas2_sidon")

הרישיון

המאגר מופץ תחת רישיון CC-BY-3.0. מותר להשתמש בו לצרכים מסחריים ולמחקר, לשנות אותו ולבנות עליו מודלים, כל עוד מעניקים קרדיט מתאים ליוצרים לפי דרישות הרישיון וציטוט המאמרים שצוינו.

הרישיון המלא ב־Hugging Face ↗