GPT
C

common_voice_22_0

קוד פתוח

fsicolicc0-1.02025-06-27

  • mozilla
  • foundation

המאגר מרכז הקלטות קוליות מתומללות בשפות מרובות לצורך אימון מודלי זיהוי דיבור. הוא מציע גרסה מעובדת ומוכנה לטעינה של פרויקט Common Voice 22 ללא צורך בהמרה ידנית מאתר מוזילה.

  • 23,047הורדות בחודש
  • 19לייקים

מה זה

מדובר בגרסה לא רשמית של קורפוס Common Voice 22 שנלקחה ישירות מהאתר של מוזילה והומרה לפורמט של ספריית datasets. הנתונים מיועדים למשימות זיהוי דיבור אוטומטי ומבוססים על הקלטות של מתנדבים שמקריאים משפטים שונים.

כל רשומה במאגר כוללת נתיב לקובץ האודיו ואת התמלול הטקסטואלי של המשפט שנאמר. לצד אלה יש מטא-דאטה שכולל גיל, מגדר, מבטא, מזהה משתמש, אזור, ודירוגי אימות קהילתיים מסוג up_votes ו־down_votes שמשמשים לסינון איכות.

הקבצים במאגר מאורגנים בארכיוני tar לפי שפות ולפי חלוקות עבודה מקובלות. תמצאו שם תיקיות ייעודיות לסט אימון, סט בדיקה, סט פיתוח, וכן תיקיות לקבצים שלא עברו אימות או שסווגו כרשומות אחרות.

מתאים ל

  • אימון מודלי זיהוי דיבור

    שימוש בהקלטות ובתמלולים לאימון מודלים של speech-to-text בשפות הנתמכות במאגר.

  • הערכת ביצועי מודלים

    בדיקת דיוק של מודלי שמע קיימים מול סטים מוכנים של בדיקה ופיתוח לפי שפה.

  • מחקר בלשני וסיווג דוברים

    ניתוח מאפייני דיבור תוך הצלבת נתוני המבטא, הגיל והמגדר של הדוברים השונים.

איפה זה נופל

זהו עיבוד לא רשמי של צד שלישי, ולכן אתם תלויים בעבודה שעשה המשתמש שהעלה אותו בלי אחריות של מוזילה. המאגר מציג רק חלק מהשפות בפירוט, כמו ערבית, אבחזית או בנגלית, ועברית אינה מופיעה ברשימת השפות שצוינו במפורש במטא-דאטה. בנוסף, נתוני גיל ומגדר נשענים על דיווח עצמי של מתנדבים, מה שמייצר הטיות דמוגרפיות מובנות בהקלטות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הדאטהסט מוגדר תחת רישיון CC0 1.0, שמשחרר את המידע לנחלת הכלל ומאפשר שימוש מסחרי מלא ללא הגבלות רישוי או חובת קרדיט.

האם המאגר כולל עברית?

עברית אינה מופיעה ברשימת השפות המפורטת בדף המאגר. הרשימה כוללת שפות כמו ערבית, אזרית, בנגלית ואחרות, ולכן לא הייתי בונה עליו עבור פרויקטים בעברית.

מה ההבדל בין מאגר זה למאגר הרשמי של מוזילה?

מדובר בהמרה עצמאית של Common Voice 22 לפורמט datasets של Hugging Face. המקור הוא אותו מקור, אבל כאן המידע מחולק מראש לטעינה נוחה בקוד.

האם חייבים להוריד את כל אלפי הקבצים למחשב?

לא. אפשר להשתמש בפרמטר הזרמה בקוד כדי לעבד את קובצי השמע בזה אחר זה, מה שמונע תפיסה של נפח אחסון יקר בדיסק המקומי.

איך טוענים

טוענים את הנתונים ישירות דרך פונקציית load_dataset של Hugging Face עם ציון קוד השפה המבוקש והחלוקה הרצויה. חובה להגדיר trust_remote_code כ־True בעת הקריאה. בגלל שמדובר באלפי קבצים ובנפח גדול, מומלץ לעבוד במצב streaming כדי לעבד דגימות ברצף ולא להוריד את כל המאגר לדיסק המקומי. השדות המרכזיים לעבודה הם קובץ האודיו, המשפט, ומספר ההצבעות שמאפשר לסנן הקלטות פחות ברורות.

from datasets import load_dataset

ds = load_dataset("fsicoli/common_voice_22_0")

הרישיון

המאגר מפורסם תחת רישיון נחלת הכלל מסוג CC0 1.0. המשמעות היא ויתור מלא על זכויות יוצרים, כך שמותר להשתמש במידע למטרות מסחריות ומחקריות בלי חובת ייחוס ובלי דרישה לשתף נגזרות באותו רישיון. אפשר לאמן עליו מודלים חופשיים או מסחריים לחלוטין.

הרישיון המלא ב־Hugging Face ↗