GPT
T

TTS-Multilingual-Test-Set

קוד פתוח

MiniMaxAIcc-by-sa-4.02025-05-09

ערכת בדיקה קומפקטית להערכת שכפול קול באפס דוגמאות על פני 24 שפות שונות. היא מיועדת בעיקר למדוד דיוק ודמיון קולי של מודלי דיבור ולא לאימון מלא.

  • 1,314הורדות בחודש
  • 44לייקים

מה זה

המאגר מכיל דגימות שמע וטקסטים שמיועדים לבחינת יכולות zero-shot voice cloning. המפתחים בחרו מתוך Mozilla Common Voice שני דוברים לכל שפה, גבר ואישה, וצירפו להם קבצי שמע קצרים בפורמט mp3 לצד תמלול. סך הכל מדובר ב־24 שפות שונות, ביניהן ערבית, אנגלית, סינית, צרפתית, גרמנית, יפנית, קוריאנית והינדי.

לכל שפה יש 100 משפטי בדיקה ייעודיים שמיועדים לסינתזה. המבנה מחולק לתיקיית speaker עם קבצי הקול שמשמשים כרפרנס לשכפול, ולתיקיית text שמרכזת קבצים שבהם כל שורה מקשרת בין מזהה קול המקור לבין הטקסט שצריך להקריא.

מתאים ל

  • בנצ'מרק לשכפול קול

    הרצת בדיקות דמיון קולי בין קובץ המקור לפלט הסינתטי על פני שפות שונות.

  • מדידת שיעור שגיאות מילים

    בדיקת מובנות הטקסט המוקרא באמצעות מודלי ASR על מאה משפטי המבחן בכל שפה.

  • השוואת מודלי דיבור

    הערכה השוואתית בין ארכיטקטורות TTS שונות מול דוברי זכר ונקבה קבועים מראש.

איפה זה נופל

זה לא סט נתונים לאימון, אלא מבחן בלבד. יש בו רק שני דוברים לכל שפה, כך שאי אפשר להסיק ממנו על עמידות המודל למבטאים מורכבים או למגוון גילאים. עברית לא נכללת ברשימת 24 השפות. אם אתם בונים מוצר לשוק המקומי, הערכה על המאגר הזה לא תגיד לכם כלום על הביצועים בעברית.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר כולל 24 שפות כמו אנגלית, ערבית, ספרדית, צרפתית ורוסית, אך עברית אינה מופיעה ברשימה שפרסמו MiniMaxAI.

האם מותר להשתמש בו לפרויקט מסחרי?

הרישיון הוא cc-by-sa-4.0 ומאפשר שימוש מסחרי, אך כולל דרישת ייחוס ושיתוף תחת אותו רישיון. המשמעות היא שאם תשנו את המאגר או תפיצו נגזרת שלו, תצטרכו לשחרר אותה ברישיון זהה.

מאיפה הגיעו קובצי האודיו?

הדגימות נלקחו מתוך מאגר Mozilla Common Voice. היוצרים בחרו משם שני דוברים לכל שפה, גבר אחד ואישה אחת, וחילקו אותם לתיקיות ייעודיות.

האם אפשר לאמן מודל דיבור על הדאטהסט הזה?

ממש לא מומלץ. יש כאן 76 קבצים בלבד עם דגימות קצרות ומאה משפטים לשפה. המטרה הבלעדית שלו היא בדיקה והערכת ביצועים ולא אימון.

איך טוענים

אין כאן צורך באישור גישה מיוחד, המאגר פתוח להורדה ישירה דרך Hugging Face. המבנה פשוט מאוד וכולל 76 קבצים בסך הכל. התיקיות מסודרות לפי שפות ומגדר, וקובצי הטקסט מופרדים בתו קו אנכי בין שם דגימת הקול לטקסט היעד, כך שקל להריץ סקריפט הערכה בסיסי כמו seed-tts-eval בלי התאמות כבדות.

from datasets import load_dataset

ds = load_dataset("MiniMaxAI/TTS-Multilingual-Test-Set")

הרישיון

הרישיון הוא cc-by-sa-4.0. מותר להשתמש בנתונים באופן מסחרי, אך חובה לתת קרדיט ליוצרים. סעיף השיתוף הזהה מחייב שכל שינוי או יצירה נגזרת מהדאטהסט יופצו תחת אותו רישיון בדיוק, מה שדורש זהירות משפטית כשמשלבים אותו בצנרת פיתוח קניינית.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗