GPT
N

NonverbalTTS

קוד פתוח

deepvkapache-2.02025-04-22

  • audio

מאגר שמביא 17 שעות דיבור באנגלית עם תיוגים של צלילים לא מילוליים כמו צחוק ונשימות. הוא נועד למי שרוצה לאמן מודלי דיבור שמביעים רגש אמיתי ולא נשמעים כמו קריין מוקלט מראש.

  • 744הורדות בחודש
  • 70לייקים

מה זה

המאגר כולל קטעי אודיו שמקורם בשני פרויקטים מוכרים, VoxCeleb ו־Expresso, בהשתתפות 2,296 דוברים שונים ביחס של 60 אחוז גברים ו־40 אחוז נשים. הנתונים מתמקדים בעשרה סוגי צלילים לא מילוליים, כולל שיעול, צחוק, אנחות, כחכוח בגרון ונחירות, לצד סיווג לשמונה קטגוריות רגש שונות כמו כעס, פחד, שמחה וניטרליות.

תהליך העבודה שילב אוטומציה ובקרה אנושית. המפתחים זיהו תחילה את הצלילים בעזרת BEATs, סיווגו רגשות עם emotion2vec פלוס וחילצו תמלול עם מודל Canary. לאחר מכן עברו על כל דגימה שלושה מתייגים אנושיים שסיננו קטעים שאינם באנגלית או קטעים עם מספר דוברים בו זמנית, וההכרעות הסופיות התקבלו באמצעות מנגנון הצבעת רוב ואלגוריתם יישור רצפים. המאגר מחולק לקובצי פרקט לפי קבוצות של אימון, בדיקה, פיתוח וקבוצה נוספת בשם other.

מתאים ל

  • כוונון עדין למודלי דיבור

    הוספת תגובות אנושיות כמו צחוק, אנחה ונשימה למודלי TTS קיימים כדי להפחית דיבור רובוטי.

  • סינתזה מותאמת רגש

    הפקת קולות דיבור המותאמים לקטגוריות רגש מוגדרות מראש כמו שמחה, כעס, הפתעה או עצב.

  • בדיקת ביצועי הבעה

    שימוש בקבוצות הבדיקה המתוייגות כדי להעריך יכולת של מודלים לחקות גווני קול שאינם מילוליים.

איפה זה נופל

המאגר מוגבל לאנגלית בלבד, כך שהוא לא יעזור ישירות למי שמפתח מודל דיבור בעברית. היקף החומר צנוע מאוד ועומד על 17 שעות בלבד, נפח שמתאים לכוונון עדין או הערכה ולא לאימון מודל בסיס מאפס. קיים גם פער איכות מובנה באודיו בגלל השילוב בין מקורות שונים, כאשר חלק מהחומר נדגם ב־16kHz בלבד, לצד חוסר איזון מגדרי של 60 אחוז גברים מול 40 אחוז נשים.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

למרות שבראש העמוד מופיע רישיון Apache 2.0, כרטיס המאגר מציין במפורש שהתיוגים מוגנים ברישיון CC BY-NC-SA 4.0 שאינו מסחרי. בנוסף לכך, זכויות האודיו עצמו כפופות לתנאי המקור של VoxCeleb ו־Expresso. בשל הסתירה הזו, לא מומלץ להשתמש בו לפיתוח מוצרים מסחריים ללא אישור מתאים.

האם יש במאגר נתונים בשפה העברית?

לא, המאגר מוגדר ומכיל אך ורק הקלטות בשפה האנגלית. המתייגים האנושיים אף סיננו והסירו קטעים שאינם באנגלית במהלך הכנת הנתונים. מי שמפתח מודל לעברית יכול ללמוד בעיקר ממתודולוגיית התיוג והשילוב של צלילים לא מילוליים, אך לא להשתמש בקבצים עצמם.

מאיפה הגיעו הנתונים ואיך וידאו את האיכות שלהם?

החומרים נלקחו מהמאגרים הציבוריים VoxCeleb ו־Expresso. החוקרים השתמשו במודלים ממוחשבים כדי לזהות תחילה צלילים, רגשות ותמלול, ולאחר מכן העבירו כל קטע לבדיקה של שלושה מתייגים אנושיים. התוצאה הסופית נקבעה באמצעות שילוב היפותזות והצבעת רוב בין המתייגים.

מה מייחד אותו מדאטהסטים רגילים לאימון דיבור?

רוב מאגרי הדיבור מתמקדים בהקראת טקסט נקי ונטול הפרעות באולפן. המאגר הזה מתרכז דווקא בצלילים שאנשים עושים באופן טבעי בזמן דיבור, כמו גניחות, התעטשות וכחכוח בגרון. הוא כולל תיוג של עשרה סוגי קולות כאלה לצד שמונה קטגוריות רגש של הדוברים.

איך טוענים

טוענים את המאגר ישירות בעזרת הספרייה datasets של Hugging Face בפקודה load_dataset ללא צורך באישור גישה מוקדם או מילוי טפסים. המאגר מגיע בפורמט פרקט ומכיל אלפי רשומות המחולקות ל־13 קבצים. בעבודה עם האודיו צריך לשים לב לשונות טכנית בסיסית, הקטעים שהגיעו מ־VoxCeleb שמורים בקצב דגימה של 16kHz, בעוד שההקלטות שמקורן ב־Expresso שמורות באיכות של 48kHz. הנתונים כוללים שדות של מזהה דובר, תיוגי רגש, תמלול מיושר ומדדי איכות קול.

from datasets import load_dataset

ds = load_dataset("deepvk/NonverbalTTS")

הרישיון

המטא-דאטה בעמוד מציין רישיון Apache 2.0, אך בתוך הטקסט של הכרטיס המפרסמים מגדירים תנאים שונים ומחמירים בהרבה. התיוגים מוגדרים תחת CC BY-NC-SA 4.0 האוסר שימוש מסחרי ומחייב שיתוף זהה, בעוד שקבצי האודיו כפופים לרישיונות המקוריים של VoxCeleb ו־Expresso. במצב כזה אסור להשתמש בחומר לאימון מודל מסחרי לפני בדיקה משפטית קפדנית של זכויות המקור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗