GPT
A

ami

קוד פתוח

edinburghcstrcc-by-4.02022-08-17

המאגר כולל 100 שעות של הקלטות פגישות באנגלית עם תמלול מלא. הוא מיועד למי שבונה או בודק מודלים לזיהוי דיבור רציף, בייחוד של דוברים שאינם ילידיים בסביבות אקוסטיות משתנות.

  • 7,171הורדות בחודש
  • 95לייקים

מה זה

הנתונים מכילים מקטעי אודיו קצרים ותמלולים מנורמלים שמקורם בהקלטות של פגישות אמיתיות. ההקלטות המקוריות שילבו אותות שסונכרנו לאותו ציר זמן, כולל מיקרופונים קרובים ומיקרופונים של שדה רחוק, מצלמות וידאו אישיות וחדריות, פלט ממקרני שקופיות ולוחות אלקטרוניים, ואף עטים שהקליטו כתב יד. הגרסה הזו מבוססת על העיבוד של מתכון ה־S5 מתוך KALDI, כלומר הטקסט עבר נרמול והאודיו נחתך למקטעים מראש.

ההקלטות נאספו בשלושה חדרים שונים שלכל אחד מהם מאפיינים אקוסטיים משלו, והמשתתפים היו ברובם דוברים שאינם ילידי השפה האנגלית. המאגר מחולק לשלושה חלקים קבועים: אימון עם 108,502 שורות, ולידציה עם 13,098 שורות, ומבחן עם 12,643 שורות.

מתאים ל

  • אימון זיהוי דיבור לפגישות

    אימון מודלים על אנגלית של דוברים לא ילידיים בסביבה מרובת משתתפים ורעשי רקע.

  • הערכת ביצועי מודלים

    בדיקת שיעור שגיאות מילים על סטי המבחן הקבועים כדי להשוות מודלים מול הספרות.

  • זיהוי דוברים שונים

    שימוש במזהי הדוברים והמיקרופונים לצורך הפרדת דוברים ומעקב אחרי קולות בחדר.

איפה זה נופל

ההקלטות נעשו כולן באנגלית, ואין כאן עברית כלל. רוב הדוברים בפגישות אינם דוברים ילידיים, מה שיוצר מבטאים מגוונים אך עלול להקשות על מודלים מסוימים או להטות את הביצועים. בנוסף, מדובר באודיו חתוך ומנורמל לפי תסריט מסוים של KALDI, כך שהוא אינו משקף שיחה רציפה גולמית ללא עיבוד. מי שמתכנן מוצר לזיהוי דיבור של דוברי אנגלית שפת אם עלול לגלות שהנתונים לא מייצגים את קהל היעד שלו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר מופץ תחת רישיון CC-BY-4.0. רישיון זה מאפשר שימוש מסחרי חופשי, כל עוד מקפידים לתת קרדיט נאות ליוצרים לפי תנאי הרישיון.

האם יש במאגר נתונים בעברית?

לא. כל ההקלטות והתמלולים במאגר הם בשפה האנגלית בלבד, ואין בו שום תוכן בעברית.

איך נאספו הנתונים במקור?

ההקלטות בוצעו בפגישות חיות בשלושה חדרים שונים עם אקוסטיקה שונה. נעשה שימוש במיקרופונים קרובים ורחוקים, מצלמות, לוחות אלקטרוניים ועטים דיגיטליים, כאשר רוב הדוברים היו דוברי אנגלית כשפה שנייה.

מה מייחד את הגרסה הזו לעומת המאגר המקורי?

גרסה זו מיישמת מראש את תהליך העיבוד של כלי KALDI. האודיו כבר חתוך למקטעים קצרים והטקסט עבר נרמול, כך שלא צריך להריץ את תסריטי החיתוך לבד.

איך טוענים

טוענים את המאגר דרך פקודת load_dataset עם השם edinburghcstr/ami והתצורה ihm, ללא צורך באישור גישה מיוחד. המאגר מחולק ל־89 קבצים בפורמט Parquet, ודגימות האודיו נטענות ישירות בפורמט WAV עם קצב דגימה של 16,000 הרץ. השדות בכל רשומה כוללים את מערך האודיו עצמו, תמלול הטקסט, זמני התחלה וסיום, מזהה פגישה, מזהה אודיו, מזהה מיקרופון ומזהה דובר.

from datasets import load_dataset

ds = load_dataset("edinburghcstr/ami")

הרישיון

הרישיון המדווח הוא CC-BY-4.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, בתנאי שנותנים קרדיט מתאים ליוצרים ומציינים אם נעשו שינויים. אין דרישה לשתף תוצרים תחת אותו רישיון בדיוק, ולכן ניתן לאמן על הנתונים מודלים סגורים או מסחריים כל עוד עומדים בדרישות הייחוס של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗