GPT
E

expresso

קוד פתוח

ylacombecc-by-nc-4.02024-04-30

מאגר קול איכותי באנגלית שמתמקד בדיבור אקספרסיבי ורגשי. הוא נותן מענה למי שרוצה לאמן מודלים על דיאלוגים מאולתרים והקראות במגוון סגנונות במקום דיבור מונוטוני רגיל.

  • 2,158הורדות בחודש
  • 96לייקים

מה זה

המאגר כולל סך הכל כמעט 46 שעות של שמע באנגלית שהוקלטו באולפן מקצועי באיכות של 48kHz ו־24bit, עם רעש רקע מינימלי. הנתונים מגיעים מארבעה דוברים בלבד, שני גברים ושתי נשים. ההקלטות מתחלקות לשני חלקים עיקריים: כ־11.5 שעות של הקראה מתוסרטת בשמונה סגנונות שונים, וקצת מעל 34 שעות של דיאלוגים מאולתרים ב־26 סגנונות.

ההקראות מגיעות בפורמט מונו יחד עם תמלול מלא של הטקסט. הדיאלוגים מגיעים בפורמט סטריאו, כאשר כל ערוץ מוקצה לשחקן נפרד כדי לשמר את החלוקה המקורית של הדוברים בשיחה. ישנם סגנונות ייחודיים כמו לחישה, צחוק, שירה, פחד, סרקזם, ואפילו דיבור שמכוון לילדים או לחיות.

מתאים ל

  • אימון מודלי הקראה רגשיים

    יצירת קולות סינתטיים שיודעים להביע כעס, שמחה או לחישה לפי דרישה.

  • סינתוז דיאלוגים

    אימון מודלים שמנהלים שיחה טבעית על בסיס ערוצי סטריאו נפרדים לכל דובר.

  • מחקר על אקספרסיביות

    בדיקת יכולת ההפרדה והשחזור של אינטונציות דיבור וסגנונות קוליים שונים.

איפה זה נופל

הבעיה המרכזית כאן היא המגוון האנושי. המאגר כולו מבוסס על ארבעה דוברים בלבד, כולם באנגלית, מה שיוצר סיכון ממשי להתאמת יתר לקולות הספציפיים שלהם. בנוסף, מדובר בהקלטות אולפן מבוקרות ומבוימות, כך שהן לא מייצגות רעשי סביבה אמיתיים. אם אתם מחפשים עברית, אין פה מילה אחת. חשוב לדעת שחלק מהסגנונות מכילים מעט מאוד דאטה, כמו קטע שירה קצרצר של ארבע דקות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

לא, הרישיון של המאגר הוא CC BY-NC 4.0. המשמעות היא שהשימוש מוגבל אך ורק למטרות מחקר ולא מסחריות. לא תוכלו למכור שירות או מוצר שמבוסס ישירות על אימון ממנו.

האם המאגר כולל עברית?

לא, המאגר מוקלט כולו בשפה האנגלית. הוא מתאים למחקר כללי על אינטונציות ודיבור, אך לא מכיל שום תוכן בעברית. לצורך אימון מודלים בעברית תצטרכו לחפש מקורות נתונים אחרים.

מאיפה הגיעו ההקלטות ואיך הן בוצעו?

הנתונים הוקלטו באולפן מקצועי באיכות 48kHz עם ארבעה שחקנים בלבד, שני גברים ושתי נשים. חלק מההקלטות נעשו בהקראה מתוסרטת והשאר בדיאלוגים מאולתרים בסגנונות רגשיים מוגדרים.

האם כל הסגנונות מגיעים עם תמלול מלא?

לא, לפי התיעוד התמלולים מסופקים עבור קטעי ההקראה המתוסרטים בלבד. הדיאלוגים המאולתרים מכילים את קובצי השמע בלבד בערוצי סטריאו נפרדים.

איך טוענים

המאגר מאורגן בקובצי Parquet, כאשר הפיצול של ההקראות מחולק ל־12 קבצים שונים תחת התצורה read. ניתן לטעון אותו ישירות באמצעות ספריית datasets של Hugging Face ללא צורך בבקשת גישה מיוחדת או אישור מוקדם. השדות כוללים את נתוני השמע והתמלולים עבור קטעי ההקראה, ומומלץ לוודא שיש לכם מספיק מקום אחסון ורוחב פס לעבודה עם קובצי אודיו מרובים באיכות גבוהה.

from datasets import load_dataset

ds = load_dataset("ylacombe/expresso")

הרישיון

המאגר מופץ תחת רישיון CC BY-NC 4.0. זה אומר שמותר להשתמש בו למטרות מחקר, לימוד ופיתוח פנימי לא מסחרי, תוך מתן קרדיט מתאים ליוצרים. אסור בהחלט להשתמש בנתונים האלה למטרות מסחריות, ומודל שאומן על המאגר לא יוכל לשמש מוצר מסחרי ישיר.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗