GPT
C

common_voice_17_0

קוד פתוח

fixie-aiרישיון לא דווח2024-07-21

המאגר מרכז הקלטות קול אנושיות לצד תמלול בעשרות שפות, כולל נתוני הצבעה ומטא-דאטה דמוגרפי. מפתחים פונים אליו כדי לאמן ולהעריך מודלי זיהוי דיבור על קולות מגוונים של מתנדבים.

  • 82,308הורדות בחודש
  • 18לייקים

מה זה

כל רשומה במאגר מורכבת מקובץ אודיו בקצב דגימה של 48kHz, משפט טקסט תואם, מזהה דובר אנונימי, ופרטים דמוגרפיים שכוללים גיל, מגדר, מבטא ושפת מקור (locale). המידע נאסף מהקלטות של תורמים עצמאיים ברחבי העולם, שקראו משפטים קצרים מתוך טקסטים מוכנים מראש. לצד ההקלטה מופיעים נתוני בקרת איכות קהילתיים, בדמות ספירת הצבעות חיוביות (up_votes) והצבעות שליליות (down_votes).

החלוקה הפנימית מופרדת לפי קודי שפות, ובכל שפה קיימת חלוקה לסט אימון (train), אימות (validation) ובדיקה (test). בחלק מהשפות קיימים פיצולים נוספים שמפרידים בין הקלטות שאומתו על ידי הקהילה (validated), כאלה שנפסלו (invalidated), ודגימות שטרם נבדקו או סווגו אחרת (other). מבנה זה מאפשר סינון לפי איכות הבקרה הקהילתית לפני שמזינים את הנתונים לאימון.

מתאים ל

  • אימון מודלי תמלול דיבור

    אימון וכיול של מודלי ASR על דיבור אנושי מגוון בשפות שונות, תוך שימוש בקובצי 48kHz וטקסט תואם.

  • מבחני דיוק וביצועים

    מדידת יחס שגיאות מילים (WER) בסט הבדיקה של שפות נבחרות, לצורך השוואת ביצועים בין ארכיטקטורות.

  • ניתוח מאפייני דוברים

    מחקר על זיהוי מאפייני גיל, מגדר ומבטא על סמך המטא-דאטה המוצמד לכל הקלטה קולית.

איפה זה נופל

ההטיות במאגר נובעות מאופיו ההתנדבותי. משתמשים בוחרים בעצמם אם להקליט ואם להזין פרטי גיל ומגדר, כך שקיים חוסר איזון מובנה באוכלוסיות הדוברים ובמבטאים. גודל הדאטה משתנה באופן קיצוני בין שפות: אנגלית וגרמנית כוללות מאות אלפי הקלטות, בעוד שפות אחרות מונות מאות בודדות של דוגמאות בלבד. איכות ההקלטות אינה אחידה עקב שימוש במיקרופונים שונים ורעשי רקע ביתיים, ולכן חובה לבצע בדיקת איכות ובקרה מדגמית לפני שילוב הנתונים במערכות ייצור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

בדף המאגר הזה הרישיון מסומן כלא דווח. בהיעדר תנאי שימוש מוגדרים מצד fixie-ai, לא ניתן לדעת אם שימוש מסחרי מותר. שימוש מסחרי במצב כזה חושף את המפתח לסיכון של הפרת זכויות יוצרים.

כמה שטח אחסון צריך להקצות עבור הורדת הנתונים?

נפח ההורדה משתנה לחלוטין לפי השפה שתבחרו לטעון. תצורת האנגלית (en) לבדה דורשת הורדה של מעל 128 גיגה-בייט, גרמנית דורשת כ־24.5 גיגה-בייט, ואילו שפות קטנות כמו האוסה (ha) שוקלות פחות מ־90 מגה-בייט.

האם המאגר כולל עברית?

על פי המידע והתצורות שנמסרו בכרטיס הדאטהסט, עברית (he) אינה מופיעה ברשימת השפות הזמינות. המאגר מציג שפות רבות אחרות, כגון ערבית, פרסית, רוסית, גרמנית וצרפתית.

כיצד סוננו ואומתו ההקלטות במאגר?

האימות מתבסס על מנגנון הצבעות קהילתי, שבו משתמשים אחרים מאשרים או פוסלים את תאימות ההקלטה לטקסט. התוצאות משתקפות בשדות up_votes ו־down_votes, ובשפות רבות הנתונים מחולקים מראש לתיקיות validated ו־invalidated בהתאם להחלטות אלו.

איך טוענים

טוענים את המאגר ישירות בספריית datasets באמצעות ציון שם התצורה של השפה המבוקשת, למשל ar לערבית או de לגרמנית. הנתונים מוגשים בפורמט Parquet בחלוקה לאלפי קבצים, והגישה פתוחה ללא צורך באישור פרטני מראש. השדות הקריטיים לתהליך הם audio לצורך המרת אות הדיבור לוקטורים, ו־sentence לשם חישוב שגיאות תמלול. במודלים רגישים לאיכות, מומלץ לסנן דגימות מראש על פי עמודות up_votes ו־down_votes כדי להימנע מהקלטות לא ברורות.

from datasets import load_dataset

ds = load_dataset("fixie-ai/common_voice_17_0")

הרישיון

הרישיון של המאגר לא דווח על ידי המפרסם fixie-ai. במצב זה, אין אישור רשמי לשימוש מסחרי, לא ברורות חובות הייחוס, ולא ידוע האם חלות הגבלות שיתוף זהה (ShareAlike) על מודלים שיאומנו עליו. עבור ארגונים וחברות, שימוש במאגר ללא רישיון מוגדר מהווה סיכון משפטי ישיר, ואינו מומלץ לסביבות ייצור לפני בירור מעמדו מול המקור.

הרישיון המלא ב־Hugging Face ↗