GPT
C

common_voice

קוד פתוח

legacy-datasetscc0-1.02022-03-02

הקלטות קול וטקסט תואם בעשרות שפות שנאספו מהמון מתנדבים ברשת. זה המקור הציבורי הנפוץ ביותר למי שבונה מודל זיהוי דיבור פתוח לגמרי בלי לשלם על רישיונות שימוש מסחריים.

  • 51,564הורדות בחודש
  • 148לייקים

מה זה

כל שורה מייצגת הקלטה של משפט בודד בקצב דגימה של 48 אלף הרץ יחד עם תמלול הטקסט התואם. לצד השמע יש מזהה לקוח אנונימי, ספירת הצבעות חיוביות ושליליות, ונתונים דמוגרפיים כמו גיל, מגדר, מבטא ושפת מקום. הנתונים מגיעים ממיזם קהילתי שבו אנשים מקליטים טקסטים מהדפדפן ומשתמשים אחרים מאמתים את איכות ההקלטה.

המאגר מחולק לפי שפות וכולל פיצול מובנה לקבוצות אימון, בדיקה ואימות. בנוסף יש קבוצה של הקלטות מאומתות שעברו ביקורת קהילתית, קבוצת פסולות שספגו הצבעות שליליות, וקבוצת אחרת שלא הגיעה להכרעה. ההבדלים בהיקף בין השפות קיצוניים. באנגלית יש מעל חצי מיליון דוגמאות אימון, בעוד בשפות כמו הינדי יש 157 דוגמאות בלבד ובאבחזית 22 דוגמאות בלבד. חלק מהשפות כמעט ולא מכילות דאטה שמיש.

מתאים ל

  • אימון זיהוי דיבור

    אימון מודלים לזיהוי דיבור באנגלית, ספרדית, צרפתית וגרמנית מההקלטות המאומתות.

  • בדיקת עמידות מודל

    הערכת ביצועי תמלול על שמע ביתי עם רעשי רקע שונים ומבטאים מגוונים.

  • סינון לפי איכות

    בניית ניסויים שבודקים איך הצבעות קהילה משפיעות על דיוק זיהוי הדיבור.

  • מחקר שפות מעוטות משאבים

    אימון מודלים מקומיים לשפות עם נפח נתונים מוגבל כמו ולשית או ברטונית.

איפה זה נופל

האיכות הטכנית מאוד לא אחידה כי ההקלטות מגיעות ממיקרופונים ביתיים פשוטים. הדיווח על גיל ומגדר הוא התנדבותי ולכן חלקי ומוטה גילאית. עברית אינה מופיעה ברשימת השפות הזמינות בגרסה הזו. בשפות רבות כמות המידע קטנה מדי לאימון אמיתי, וספליט האימון כולל רק שבריר מכמות הדגימות המאומתות.

שאלות
נפוצות

האם יש במאגר הזה תמיכה בעברית?

לא. ברשימת השפות של המאגר הזה עברית לא קיימת בכלל, ולכן הוא לא מתאים לפרויקטים מקומיים.

האם מותר להשתמש במידע במוצר מסחרי?

כן. הרישיון הוא נחלת הכלל, מה שמאפשר שימוש מסחרי חופשי באימון מודלים ומכירת התוצרים ללא תמלוגים.

כמה שטח אחסון צריך בשביל לעבוד איתו?

זה תלוי בשפה שבוחרים. שפה קטנה תופסת עשרות מגה בייטים, אבל הורדת המאגר באנגלית בלבד דורשת יותר משישים גיגה בייט.

איך יודעים אילו הקלטות איכותיות ואילו לא?

לכל הקלטה מוצמד מספר הצבעות חיוביות ושליליות. בנוסף המאגר כבר מחולק מראש לדגימות מאומתות ודגימות שנפסלו על ידי הקהילה.

איך טוענים

טוענים את המאגר ישירות עם ספריית הדאטהסטס בקוד לפי קוד השפה המבוקש. אין צורך בבקשת גישה או אישור מוקדם וההורדה פתוחה. חייבים לקחת בחשבון את נפח האחסון, מכיוון שהורדת שפה גדולה כמו אנגלית דורשת מעל שישים גיגה בייט של הורדה ותופסת מעל תשעים גיגה בייט על הדיסק. השדות המרכזיים לעבודה הם השמע, שדה הטקסט, ומספר ההצבעות החיוביות והשליליות לסינון רעשים.

from datasets import load_dataset

ds = load_dataset("legacy-datasets/common_voice")

הרישיון

המאגר מופץ תחת נחלת הכלל בתקן סי סי אפס. מותר להשתמש בנתונים לכל צורך כולל אימון מודלים מסחריים, שינוי, והפצה מחדש בלי חובת ייחוס ובלי דרישה לשתף את המודל המאומן באותו הרישיון.

הרישיון המלא ב־Hugging Face ↗