GPT
M

Multilingual-TTS

קוד פתוח

malaysia-aicc-by-nc-4.02025-09-21

אוסף ענק של אלפי קטעי דיבור ותמלילים בעשרות שפות מגוונות. הוא מיועד למי שצריך לכסות שפות אסייתיות, אפריקאיות ומזרח תיכוניות בלי ללקט כל מקור בנפרד.

  • 7,206הורדות בחודש
  • 24לייקים

מה זה

במקום מאגר אחיד שנאסף מאפס, יש כאן איגום של עשרות סטים פומביים שונים שמכילים טקסט ואודיו תואם. המבנה מבוסס על קונפיגורציות שונות, כשכל אחת מייצגת פרויקט מקור אחר, החל מיוזמות קוד פתוח כמו AISHELL או IndicTTS ועד הקלטות ממשלתיות, ניבים מקומיים ואודיו סינתטי.

הכרטיס לא מתאר תהליך סינון אחיד, הסרת רעשים או בדיקות תקינות גלובליות שנערכו על כל החומרים. חלק מהמקורות מגיעים ממאגרי זיהוי דיבור, חלקם ספרי שמע וחלקם הוקלטו מראש עבור סינתזה. הפיצול הפנימי מסודר לקבוצות אימון לפי כל מקור, לצד קובצי ארכיון שמכילים את האודיו הדחוס.

מתאים ל

  • אימון מודלי דיבור אקדמיים

    פיתוח ארכיטקטורות TTS רב-לשוניות למחקר תיאורטי בלבד, ללא כוונת רווח.

  • הערכת ביצועי ASR במחקר

    בדיקת שגיאות זיהוי של מודלים קיימים על פני עשרות שפות וניבים מקומיים.

  • ניסויי קודק אודיו מודרניים

    אימון ובחינת מודלי דחיסת קול בעזרת קובצי neucodec המצורפים.

איפה זה נופל

אין כאן עברית כלל. השפות המובילות הן אסייתיות, ערבית ושפות אירופיות מרכזיות, לצד שפות בעלות משאבים נמוכים. מעבר לזה, הערבוב בין מקורות שונים יוצר שונות קיצונית באיכות השמע, בקצבי הדגימה וברמת הדיוק של התמלילים. הכרטיס לא מציין תאריכי הקלטה, חלוקת מגדר או סינון הטיות, ולכן חובה לבדוק ידנית כל תת-מאגר שרוצים לשלב במודל.

שאלות
נפוצות

האם אפשר להשתמש בדאטהסט במוצר מסחרי?

לא. הרישיון הוא CC BY-NC 4.0, מה שאוסר כל שימוש מסחרי ישיר או שילוב של מודל שאומן עליו במוצר שמייצר רווח.

האם המאגר כולל עברית?

לא. המאגר מכיל שפות כמו ערבית, אנגלית, סינית, שפות הודיות ועוד, אך עברית אינה נכללת ברשימת השפות הנתמכות.

איך מאורגן האודיו במאגר?

המידע מופרד לקונפיגורציות עצמאיות לכל מקור. התמלילים יושבים בקובצי parquet, וקובצי הקול עצמם ארוזים בקובצי zip נפרדים המיועדים להורדה לצד הטבלאות.

האם איכות ההקלטות אחידה בכל התצורות?

ממש לא. מדובר באיסוף של עשרות פרויקטים נפרדים, מחלקם מבוססי דיבור באולפן ועד הקלטות רשת שונות, ולכן האיכות והקידוד משתנים מתצורה לתצורה.

איך טוענים

טוענים תצורה בודדת מתוך המאגר באמצעות שמה הספציפי, למשל 700h-tr-turkish-text-to-speech, כדי לא להוריד אלפי קבצים במכה. הנתונים מחולקים לקובצי parquet המכילים את התמלילים והמטא-דאטה, ולצידם ארכיוני zip עבור האודיו הגולמי וגרסאות מקודדות כמו neucodec. אין צורך בבקשת גישה מיוחדת, הכל פתוח להורדה ישירה.

from datasets import load_dataset

ds = load_dataset("malaysia-ai/Multilingual-TTS")

הרישיון

הרישיון המדווח הוא CC BY-NC 4.0, שמשמעותו איסור מוחלט על שימוש מסחרי מכל סוג שהוא. מותר להשתמש בנתונים למחקר, ניסויים והערכה אקדמית, תוך מתן קרדיט מלא. מודל שאומן על הדאטהסט הזה לא יוכל להימכר, להשתלב במוצר מסחרי או לתמוך בפעילות עסקית כלשהי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗