GPT
V

vibravox

קוד פתוח

Cnam-LMSSCcc-by-4.02023-10-18

הקלטות דיבור בצרפתית משישה חיישנים שונים במקביל, כולל מיקרופונים רגילים וחיישני הולכת עצם. הוא מתאים למי שמפתח מערכות זיהוי או שיפור קול בסביבות רועשות במיוחד.

  • 15,586הורדות בחודש
  • 30לייקים

מה זה

הרשומות מכילות קטעי קול שנדגמו מ־200 דוברים, כאשר כל משפט הוקלט בו-זמנית בשישה ערוצים נפרדים: מיקרופון ראש רגיל, שני מיקרופוני תוך-אוזן, חיישן מצח, חיישן רקתי ולרינגופון על הגרון. הטקסטים שהוקראו נלקחו מוויקיפדיה הצרפתית, והחומר כולל 28,095 משפטי דיבור באורך כולל של 45.62 שעות לכל ערוץ שמע. הנתונים מחולקים לארבעה חלקים עיקריים שנועדו למטרות שונות.

החלקים נבדלים בתנאי ההקלטה: דיבור בסביבה שקטה, דיבור בסביבה רועשת שנוצרה באמצעות מערך של 56 רמקולים, ושני חלקים שבהם המשתתפים שותקים בסביבה שקטה או רועשת כדי לתעד רעשים פיזיולוגיים ורעשי רקע. כל חלק מחולק לסט אימון, תיקוף ובדיקה ללא חפיפת דוברים ביניהם. רשומות הדיבור כוללות טקסט גולמי, טקסט מנורמל ותעתיק פונטי באלפבית פונטי בינלאומי.

מתאים ל

  • זיהוי דיבור ברעש קיצוני

    אימון מודלי תמלול על בסיס חיישני גרון או אוזן, שקולטים את קול הדובר גם בתוך המולה תעשייתית קשה.

  • שחזור רוחב פס קולי

    בניית מודלים שלומדים להשלים תדרים גבוהים שאבדו בקלט מחיישני מגע, באמצעות השוואה למיקרופון הראש.

  • אימות דובר ביומטרי

    חילוץ מאפייני קול ייחודיים מחיישנים פיזיולוגיים לצורך זיהוי משתמשים במערכות אבטחה.

איפה זה נופל

הנתונים כולם בצרפתית, כך שהם לא יעזרו ישירות לאימון מודלים אקוסטיים לעברית או לשפות אחרות. האיסוף נשען על 200 דוברים בלבד שמקריאים טקסטים כתובים מוויקיפדיה, מצב שרחוק משיחה ספונטנית בחיים האמיתיים. בנוסף, חיישני הולכת עצם סובלים מטבעם מרוחב פס מוגבל ותדרים חסרים, ולכן מודל שיאומן עליהם ידרוש התאמה מיוחדת ולא יתאים למיקרופון סלולרי רגיל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא, כולל אימון מודלים פנימיים. הדרישה היחידה היא לתת קרדיט נאות ליוצרי המאגר במקומות הנדרשים.

כמה מקום בדיסק צריך כדי להוריד אותו?

נפח ההורדה הכולל עומד על 186.64 ג'יגה-בייט בגלל איכות השמע ומספר הערוצים. אם אין לכם מקום, אפשר להשתמש במצב הזרמה או להוריד רק תת-מאגר אחד.

האם יש במאגר דגימות בעברית?

לא, כל ההקלטות והטקסטים במאגר הם בצרפתית בלבד. הוא שימושי בעיקר לפיתוח ארכיטקטורות של מודלים לחיישני מגע, אך לא לאימון ASR ייעודי לעברית.

במה הוא שונה ממאגרי דיבור רגילים?

רוב המאגרים מקליטים גלי קול באוויר עם מיקרופון סטנדרטי. כאן הוקלטו במקביל חמישה חיישני גוף שונים, שמעבירים רטט ישירות מעצמות הפנים והגרון ללא רעשי רוח וסביבה.

איך טוענים

טוענים את המאגר ישירות מקוד פייתון בעזרת load_dataset תוך בחירת התת-מאגר הרצוי, למשל speech_clean. כל הקבצים שמורים בפורמט Parquet שמכיל קובצי שמע PCM32 ב־48 קילו-הרץ, וסך ההורדה מגיע ל־186.64 ג'יגה-בייט. אין צורך באישור גישה ידני, אבל עקב המשקל מומלץ מאוד לעבוד במצב streaming. השדות המרכזיים שתרצו לגשת אליהם הם ששת ערוצי השמע, מזהה הדובר, והשדות raw_text ו־phonemes.

from datasets import load_dataset

ds = load_dataset("Cnam-LMSSC/vibravox")

הרישיון

המאגר מופץ תחת רישיון Creative Commons Attribution 4.0 שמתיר שימוש מסחרי, שינוי והפצה. התנאי היחיד הוא מתן קרדיט ברור למחקר ולמעבדת Cnam-LMSSC. אין חובה לשתף את המודל המאומן או את הנגזרות תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗