GPT
M

ml_spoken_words

קוד פתוח

MLCommonscc-by-4.02022-03-02

  • other-keyword-spotting

מעל 23.4 מיליון דגימות אודיו באורך שנייה ב־50 שפות שונות. הפרויקט חותך מילים בודדות מתוך הקלטות קהילתיות כדי לאמן זיהוי מילות מפתח בלי לחתוך קבצים ידנית.

  • 4,410הורדות בחודש
  • 37לייקים

מה זה

כל רשומה במאגר כוללת קטע קול קצר של מילה אחת, את הטקסט שנאמר, מזהה דובר, שיוך מגדרי וסימון האם הדגימה תקינה. המידע נגזר כולו מתוך מאגר Common Voice של מוזילה, שבו מתנדבים מקליטים משפטים שלמים מהרשת. היוצרים הפעילו מודל forced alignment על המשפטים האלה, העריכו את התזמון המדויק של כל מילה וחתכו אותה החוצה יחד עם נתוני היישור.

הנתונים מחולקים לפי שפות, ובתוך כל שפה לסטים של אימון, בדיקה ואימות. יש פה מעל 340,000 מילות מפתח, שמסתכמות בלמעלה מ־6,000 שעות דיבור. החלוקה הפנימית מפרידה בין שפות בעלות היקף קטן מתחת לעשר שעות כמו ערבית, אסאמית או יוונית, שפות בינוניות כמו צ'כית וטורקית, ושפות עתירות משאבים מעל מאה שעות כמו אנגלית, גרמנית, צרפתית וקטלאנית.

מתאים ל

  • זיהוי מילות הפעלה

    אימון מודלים מקומיים קטנים להאזנה למילות פקודה קבועות במכשירי קצה ורמקולים.

  • חיפוש בשיחות מוקד

    איתור מונחים וביטויים מוגדרים מראש בתוך הקלטות שמע ארוכות של מוקדי שירות.

  • אימון זיהוי קולי רב לשוני

    בדיקת יכולות הכללה וסיווג אודיו על פני 50 שפות שונות בפורמט אחיד.

איפה זה נופל

עברית לא קיימת כאן בכלל, כך שלפרויקטים מקומיים הוא לא יעזור ישירות. בנוסף, החיתוך מבוסס על מודל אוטומטי ולא על בדיקה אנושית, מה שאומר שחלק מהמילים נחתכות מוקדם מדי או מכילות רעשי רקע של המילה הבאה במשפט. פיזור הדאטה בין השפות קיצוני מאוד. בזמן שבאנגלית יש 1957 שעות ובגרמנית 1083 שעות, בדביהי או באסאמית יש שברירי שעה בלבד. אסור גם לנסות לחשוף את זהות הדוברים שתרמו את קולם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא CC-BY 4.0, והוא מאפשר שימוש מסחרי מלא. הדרישה המרכזית היא מתן קרדיט מתאים ליוצרי המאגר.

האם יש במאגר הקלטות בעברית?

לא. המאגר מכיל 50 שפות שונות אבל עברית אינה נכללת בהן. אם צריך מודל לשפה המקומית, תצטרכו לחפש מקור אחר.

כמה שטח אחסון צריך כדי להוריד את הקבצים?

הנפח משתנה מאוד לפי השפה שתבחרו. שפות קטנות שוקלות עשרות מגה בייטים בודדים, בעוד שאנגלית תופסת 26G וגרמנית 14G.

איך הדגימות נאספו ונחתכו?

האודיו מגיע מהקלטות משפטים של פרויקט Common Voice. החוקרים הפעילו תהליך יישור ממוחשב שזיהה את גבולות המילים וחתך אותן לקטעים של שנייה אחת.

איך טוענים

טוענים את המאגר ישירות עם load_dataset ומגדירים שפה ופורמט, למשל wav בתדר 16KHz או opus בתדר 48KHz. אין צורך בבקשת גישה מיוחדת, אבל חשוב להוריד רק את השפות שמעניינות אתכם כי קבצי המקור עצומים. אנגלית לבדה שוקלת 26G וגרמנית 14G. בעבודה עם הקוד מומלץ לגשת קודם לאינדקס הרשומה ורק אז לשדה האודיו כדי לא לפענח קבצים מיותרים בזיכרון.

from datasets import load_dataset

ds = load_dataset("MLCommons/ml_spoken_words")

הרישיון

רישיון CC-BY 4.0 חופשי מאוד ומתיר שימוש מחקרי ומסחרי, כולל אימון מודלים למוצרים פנימיים או חיצוניים. התנאי היחיד הוא מתן קרדיט ברור למפרסמי המאגר. הרישיון אינו דורש פתיחת קוד של מוצר שמשתמש בו.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗