GPT
V

voxbox

קוד פתוח

SparkAudiocc-by-nc-sa-4.02025-04-07

  • speech
  • audio

אוסף נתוני דיבור דו-לשוני באנגלית ובסינית שכולל תמלולים נקיים ומטא-דאטה אקוסטי מפורט. הוא נבנה עבור אימון מודלי הקראת טקסט שדורשים שליטה במאפייני קול, קצב ורגש.

  • 45,575הורדות בחודש
  • 76לייקים

מה זה

המאגר מאגד קורפוסים מוכרים של דיבור ומארגן אותם במבנה אחיד. תמצאו כאן הקלטות ממקורות שונים כמו commonvoice באנגלית ובסינית, aishell-3, casia, wenetspeech4tts ו־VCTK. המטרה של המפרסמים היתה לקחת אוספים קיימים, לסדר את המידע מחדש, ולהוסיף שכבת תיוג עשירה שמקלה על אימון מודלים.

כל רשומה מיוצגת בשורת JSONL ייעודית לפי תת-המאגר שממנו הגיעה. המטא-דאטה כולל תמלול טקסטואלי, פירוק לרמת הברות ופונמות, ומשך הדיבור נטו ללא שקט בקצוות. בנוסף יש חילוץ של תכונות אקוסטיות כמו גובה צליל, סטיית תקן של הפיץ' ומהירות דיבור, לצד מאפייני דובר כמו מגדר, קבוצת גיל וסיווג רגש במידה שהוא זוהה.

הקבצים מחולקים לשתי ספריות עיקריות, אחת מכילה את קובצי המטא-דאטה והשנייה מכילה את קובצי השמע עצמם. השמע מאורגן בארכיונים דחוסים לפי תת-הקורפוס, כשכל רשומת מטא-דאטה מצביעה ישירות על הנתיב של קובץ האודיו הרלוונטי בתוך הארכיון.

מתאים ל

  • אימון מודלי TTS

    בניית מודלים להקראת טקסט באנגלית ובסינית המסתמכים על תמלול פונטי ותכונות קול.

  • שליטה בסגנון דיבור

    התאמת גובה צליל, קצב דיבור ומאפייני דובר באמצעות המטא-דאטה האקוסטי המצורף.

  • מחקר בתחום עיבוד דיבור

    ניסויים אקדמיים על קורפוסים מרובי דוברים עם חלוקה מוגדרת לאימון ובדיקה.

איפה זה נופל

המאגר מוגבל לשתי שפות בלבד, אנגלית וסינית, ואין בו שום תמיכה בשפות אחרות או בעברית. שדות מסוימים במטא-דאטה אינם מלאים בכל הרשומות, כך למשל שדה הרגש מסומן לעיתים קרובות כלא ידוע. בנוסף, המאגר הוא אגרגציה של מקורות שונים שחלקם הוקלטו בתנאי אולפן ואחרים בתנאי שטח על ידי מתנדבים, מה שמייצר שונות גדולה באיכות האודיו וברעשי הרקע בין תתי-המאגרים השונים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון המוצהר הוא לשימוש לא מסחרי בלבד, ומחייב שיתוף זהה. כל מודל או תוצר שתפתחו באמצעותו מוגבל למטרות מחקר ולא יכול לשמש בפעילות עסקית.

האם יש בדאטהסט תמיכה בעברית?

אין שום תמיכה בעברית. המאגר מכיל אך ורק הקלטות ותמלולים באנגלית ובסינית.

מאיפה הגיעו הנתונים שנמצאים במאגר?

היוצרים אספו ואיחדו קורפוסים פתוחים קיימים כמו aishell-3, casia, commonvoice ו־wenetspeech4tts. הם חילצו מתוכם מדדים אקוסטיים והוסיפו תיוג אחיד עבור כל תת-מאגר.

מה צריך להכין לפני שמתחילים להוריד את הקבצים?

בשל היקף הנתונים שמכיל עשרות מיליוני רשומות ומאות ארכיונים דחוסים, צריך לוודא שיש לכם נפח אחסון פנוי משמעותי. מומלץ להשתמש בסקריפטי ההורדה שמספקים היוצרים במאגר הגיטהאב שלהם כדי לנהל את פריסת הקבצים בצורה מסודרת.

איך טוענים

המאגר מכיל 585 קבצים ודורש הורדה של קובצי מטא-דאטה בפורמט JSONL וארכיונים דחוסים של אודיו שמחולקים לפי מקורות. כדי לעבוד איתו צריך לחלץ את ארכיוני ה־tar.gz אל תיקיות השמע המקומיות, ולקשר בין רשומות הטקסט לקובצי האודיו דרך השדה wav_path. אין כאן דרישה לאישור גישה ידני, אך ההורדה דורשת סקריפטים מתאימים ומקום אחסון משמעותי בשל כמות הרשומות הגדולה שמגיעה לעשרות מיליונים.

from datasets import load_dataset

ds = load_dataset("SparkAudio/voxbox")

הרישיון

הרישיון המדווח הוא cc-by-nc-sa-4.0, מה שאוסר שימוש מסחרי מכל סוג ומחייב שיתוף של יצירות נגזרות תחת אותו רישיון בדיוק. מודל שתאמנו על המאגר הזה יהיה מוגבל למחקר בלבד. מעבר לכך, המפרסמים מדגישים שכל תת-מאגר כפוף לרישיון המקורי שלו, ולכן עליכם לוודא תאימות גם מול תנאי השימוש של מקורות הבסיס.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗