GPT
M

multilingual_audio_alignments

קוד פתוח

AAdoniscc-by-4.02026-01-07

  • audio
  • speech
  • phoneme-alignment
  • mfa
  • forced-alignment

המאגר מרכז מעל עשרים אלף שעות דיבור בעשר שפות עם חיתוך זמנים מדויק ברמת הפונמה והמילה. הוא נבנה במיוחד לאימון מודלים של עריכת דיבור, סינתזה קולית וזיהוי פונטי.

  • 3,618הורדות בחודש
  • 27לייקים

מה זה

כל רשומה כוללת אות שמע שנדגם בתדר של 16 קילוהרץ, תמלול טקסטואלי מלא, ייצוג פונטי באלפבית פונטי בינלאומי, ומערכים שמגדירים את זמני ההתחלה והסיום של כל מילה ופונמה. הנתונים מגיעים משילוב של מאגרי שמע קיימים, ביניהם קולות של משחקים, ספרי שמע ציבוריים, הרצאות ושיחות פרלמנטריות, כאשר לכל שפה נבחרו מקורות שונים.

העיבוד בוצע באמצעות הכלי Montreal Forced Aligner על בסיס מודלים אקוסטיים ייעודיים לכל שפה. במהלך העיבוד הטקסט והשמע פוצלו וסוננו בנקודות שבהן הופיעו מילים לא מזוהות או סימוני רעש דיבור, לצד סינון של קטעים שלא עמדו בספי אורך מינימליים ומקסימליים או בספירת מילים נדרשת.

מתאים ל

  • עריכת דיבור מדויקת

    אימון מודלים להחלפה, מחיקה או הוספה של מילים בתוך הקלטת שמע קיימת לפי זמנים מדויקים.

  • אימון מנועי הקראה

    בניית מודלי דיבור מבוססי טקסט שדורשים למידה על ייצוגי פונמות וזמני הגייה מוגדרים.

  • זיהוי דיבור ברמת פונמות

    פיתוח מודלי זיהוי שמע שמתמקדים בחילוץ פונטי או בדיקת איכות הגייה בשפות נתמכות.

איפה זה נופל

עברית לא נכללת במאגר, והוא מוגבל לעשר שפות בלבד. בנוסף, מספר השעות והדגימות המדויק לכל שפה לא מפורט בכרטיס, והיקף של מעל עשרים אלף שעות הוא הערכה כללית בלבד. מאחר שהחיתוך נעשה בצורה אוטומטית לחלוטין על ידי מודל יישור, תיתכנה סטיות תזמון בקטעים רועשים או במבטאים חריגים.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא. המאגר מכסה רק עשר שפות ספציפיות: אנגלית, גרמנית, צרפתית, ספרדית, רוסית, יפנית, קוריאנית, פורטוגזית, טורקית ותאילנדית. אם אתם צריכים לאמן מודל לעברית, תצטרכו לייצר יישורים עצמאיים באמצעות מודל אקוסטי מתאים.

האם מותר להשתמש במידע לפיתוח מוצר מסחרי?

הרישיון של המאגר עצמו הוא CC-BY-4.0 שמאפשר שימוש מסחרי בכפוף למתן קרדיט. יחד עם זאת, החומרים נאספו ממגוון פרויקטים ומאגרים חיצוניים, והיוצרים מבהירים שחובה לבדוק ולכבד את הרישיונות של כל מקור מקורי בנפרד.

איך נוצרו זמני החיתוך של המילים והפונמות?

היישור בוצע אוטומטית באמצעות כלי שנקרא Montreal Forced Aligner, שמתאים בין הטקסט לקובץ השמע בעזרת מילוני הגייה ומודלים אקוסטיים. קטעים שכללו מילים לא מוכרות או רעשי דיבור נחתכו וסוננו החוצה כדי לשמור על איכות התזמונים.

מה הגודל של המאגר והאם אפשר להוריד רק חלק ממנו?

המאגר כולל מעל 2,200 קבצים בפורמט פרקט ומכיל לפי הערכת היוצרים מעל עשרים אלף שעות שמע. אפשר ומומלץ לטעון רק שפה מסוימת בכל פעם באמצעות העברת שם השפה לפונקציית הטעינה, בלי להוריד את כל המאגר.

איך טוענים

טוענים את המידע באמצעות ספריית datasets עם ציון השפה הרצויה כתצורה, למשל אנגלית או גרמנית, תחת החלוקה train. המאגר פתוח לגישה חופשית ללא צורך באישור, ומאוחסן בפורמט פרקט שמחולק לאלפי קבצים. השדות המרכזיים לעבודה הם phonemes ו־words שמחזיקים את נתוני התזמון, ושדה audio שמחזיר את מערך הדגימות.

from datasets import load_dataset

ds = load_dataset("AAdonis/multilingual_audio_alignments")

הרישיון

הרישיון המוצהר הוא CC-BY-4.0 שמתיר שימוש מסחרי, שינוי והפצה, בתנאי שניתן קרדיט מתאים ליוצרים. עם זאת, המאגר מורכב מאיסוף של מקורות שונים כמו משחקים וספרי שמע, והיוצרים מציינים שיש לציית גם לתנאי הרישיון המקוריים של כל מאגר מקור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗