GPT
V

vctk

קוד פתוח

CSTR-Edinburghcc-by-4.02022-03-02

מאגר קול של כארבעים וארבע שעות דיבור באנגלית, מפי מאה ועשרה דוברים במבטאים שונים. הוא מתאים למי שבונה מודלים של דיבור או זיהוי קול וצריך גיוון רב של דוברים באיכות הקלטה גבוהה.

  • 1,262הורדות בחודש
  • 56לייקים

מה זה

המאגר כולל הקלטות של מאה ועשרה דוברי אנגלית שתרמו את קולם ברשת. כל דובר מקריא בערך ארבע מאות משפטים שנלקחו מעיתון, מקטע קריאה מוכר בשם rainbow passage, ומפסקה מתוך ארכיון מבטאי דיבור.

כל רשומה מכילה את קובץ השמע בפורמט FLAC בערוץ בודד עם קצב דגימה של 48000 הרץ, לצד הטקסט התואם שנאמר. בנוסף מצורפים מטא-דאטה מפורטים הכוללים מזהה דובר, גיל, מגדר, מבטא, אזור גאוגרפי של הדובר אם קיים, והערות שונות. אין במאגר חלוקה מובנית לחלקי אימון, בדיקה או ולידציה, כך שצריך לחלק אותו לבד לפי צורכי הפרויקט.

מתאים ל

  • סינתזת דיבור רב-דוברת

    אימון מודלי טקסט לדיבור שמסוגלים לחקות סגנונות ומבטאים שונים באנגלית.

  • זיהוי דוברים

    פיתוח מודלים לסיווג והבחנה בין דוברים על בסיס נתוני המזהה והמבטא ברשומות.

  • זיהוי דיבור אוטומטי

    אימון ובדיקה של מערכות תמלול דיבור לטקסט מול מגוון רחב של מבטאים.

איפה זה נופל

המאגר מכיל אנגלית בלבד ואין בו שום ייצוג לעברית. כל המשפטים מוקראים מטקסט כתוב, כך שלא מדובר בדיבור ספונטני או בשיחות טבעיות מרובות משתתפים. הכרטיס לא מפרט נתונים לגבי הטיות דמוגרפיות או חלוקת הגילאים המדויקת, ויש הסכמה מפורשת לא לנסות לזהות את האנשים שתרמו את קולם. מי שמתכנן מוצר לזיהוי דיבור חופשי או רועש יצטרך לבדוק התאמה בנפרד, כי ההקלטות נקיות ומוקראות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא CC-BY-4.0 ומאפשר שימוש מסחרי מלא. התנאי המרכזי הוא מתן ייחוס מתאים למחברים המקוריים לפי ההנחיות ברישיון. יש גם התחייבות לא לנסות לחשוף את זהות הדוברים שתרמו את קולם.

האם המאגר כולל הקלטות או טקסטים בעברית?

לא. המאגר מכיל אך ורק הקלטות בשפה האנגלית, ממגוון דוברים בעלי מבטאים שונים.

איך נאסף המידע בדאטהסט הזה?

ההקלטות נתרמו ברשת על ידי מאה ועשרה אנשים שהקריאו טקסטים קבועים. הטקסטים נלקחו מעיתון, מפסקה ידועה בשם rainbow passage, ומטקסט ייעודי מתוך ארכיון מבטאי דיבור.

האם יש במאגר חלוקה מובנית לאימון ובדיקה?

לא, הכרטיס מציין במפורש שאין חלוקות מוגדרות מראש. תצטרכו להגדיר בעצמכם את הפיצול בין נתוני אימון, ולידציה ובדיקה, רצוי תוך התחשבות בחלוקת הדוברים.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה הרגילה של האגינג פייס בעזרת הסקריפט vctk.py. אין צורך באישור גישה מיוחד כדי להוריד אותו. השדות המרכזיים לעבודה הם audio שמכיל את מערך הדגימות ואת קצב הדגימה, text שמחזיק את התמלול, ו־speaker_id יחד עם accent למשימות שדורשות הבחנה בין דוברים. בגלל קצב הדגימה הגבוה של ההקלטות כדאי להביא בחשבון את נפח האחסון הנדרש בזיכרון בזמן הטעינה.

from datasets import load_dataset

ds = load_dataset("CSTR-Edinburgh/vctk")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0. הרישיון מתיר שימוש מסחרי, מחקרי ושינוי של החומר, כל עוד נותנים קרדיט מתאים ליוצרים ומציינים אם נעשו שינויים. אין דרישה לשתף תוצרים או מודלים מאומנים תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗