GPT
S

speechocean762

קוד פתוח

mispeechapache-2.02023-11-25

  • pronunciation-scoring

המאגר כולל חמשת אלפים הקלטות אנגלית של דוברי מנדרינית עם ציוני הגייה מפורטים. הוא נבנה במיוחד לבדיקה ואימון של מערכות להערכת דיבור ולימוד שפה.

  • 2,744הורדות בחודש
  • 28לייקים

מה זה

הנתונים מורכבים מחמשת אלפים משפטים באנגלית שמבוטאים על ידי דוברים שאינם ילידיים, כולם דוברי מנדרינית כשפת אם. חצי מהדוברים הם ילדים וחצי מבוגרים, כאשר לכל הקלטה מצורף מידע על גיל ומין הדובר. חמישה מומחים נתנו את הציונים לכל הקלטה באופן עצמאי לפי מדדים אחידים, כדי לצמצם הטיות סובייקטיביות בהערכה.

התיוג נעשה בשלוש רמות שונות. ברמת המשפט המומחים דירגו דיוק, שטף, שלמות ופרוזודיה בסולמות של אפס עד עשר. ברמת המילה נמדדו דיוק והטעמה נכונה, וברמת הפונמה ניתן ציון בין אפס לשתיים. כאשר פונמה קיבלה ציון נמוך מחצי, המתייגים ציינו איזו פונמה נאמרה בפועל במקום זו המקורית, מה שמאפשר לזהות דפוסי שגיאות קונקרטיים.

מתאים ל

  • הערכת הגייה באפליקציות שפה

    אימון מודל שבודק דיוק ושטף דיבור של תלמידים באנגלית ברמת הפונמה והמילה.

  • זיהוי שגיאות פונטיות

    מיפוי פונמות שהוחלפו בצליל אחר כדי לתת משוב ממוקד ללומדי אנגלית.

  • בנצ'מרק למודלי ניקוד דיבור

    בדיקת איכות אלגוריתמים מול ציונים ידניים של חמישה מומחים בלתי תלויים.

איפה זה נופל

כל הדוברים מגיעים מרקע שפתי יחיד של מנדרינית, ולכן אי אפשר להשליך מהביצועים כאן על מבטאים אחרים כמו מבטא ישראלי. חמשת אלפים משפטים זה היקף קטן למדי לאימון מודלי דיבור מאפס, מה שמגביל את השימוש בעיקר לכוונון עדין או הערכה. בנוסף, חצי מהדוברים הם ילדים, מה שעלול לייצר קושי למודלים שלא הוכנו מראש לגוני קול כאלה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא אפאצ'י שתיים אפס ויוצרי המאגר מציינים במפורש שהוא מיועד להורדה חינמית למטרות מסחריות ושאינן מסחריות. כל מה שנדרש זה לשמור על תנאי הרישיון ולתת ייחוס מתאים.

האם המאגר רלוונטי ללומדי אנגלית ישראלים?

הוא יכול לעזור כבסיס כללי למערכת ניקוד, אבל כל הדוברים במאגר הם דוברי מנדרינית כשפת אם. טעויות ההגייה והמבטא משקפים דפוסי דיבור ספציפיים לשפה הזו, ולכן המודל לא יכיר שגיאות אופייניות של דוברי עברית.

איך נקבעו הציונים של ההקלטות?

חמישה מומחים נתנו ציונים עצמאיים לפי סט קריטריונים אחיד ברמת המשפט, המילה והפונמה. השיטה הזו נועדה לנטרל את ההטיה הסובייקטיבית של בודק יחיד ולספק ציוני ייחוס עקביים.

באיזה פורמט המידע מגיע וכמה רשומות יש בו?

המאגר מכיל חמשת אלפים משפטים המחולקים לקובצי פרקט של אימון ובדיקה. גודל המאגר כולו נע בין אלף לעשרת אלפים רשומות שכוללות טקסט, שמע, תיוג פונטי ומטא דאטה.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטס הרגילה בלי צורך באישור גישה מיוחד. הקבצים שמורים בפורמט פרקט ומחולקים לסט אימון וסט בדיקה, בנפח כולל של בין אלף לעשרת אלפים רשומות. המבנה כולל את קובצי השמע לצד שדות טקסט, מערכי פונמות, ציוני דיוק, שגיאות הגייה ומטא דאטה של גיל ומין.

from datasets import load_dataset

ds = load_dataset("mispeech/speechocean762")

הרישיון

המאגר שוחרר תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים ומחקר, לשנות את הנתונים ולשלב אותם במוצרים סגורים. הדרישה העיקרית היא מתן קרדיט ושמירה על תנאי הרישיון המקוריים בהפצה של הנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗