GPT
C

fsicoli/common_voice_17_0

קוד פתוח

fsicolicc0-1.02024-03-22

  • mozilla
  • foundation

גרסה מומרת של מאגר מוזילה לזיהוי דיבור במגוון שפות. המאגר מציע הקלטות קול מתויגות עם טקסט, נתוני הצבעות ודמוגרפיה לפי שפה.

  • 13,606הורדות בחודש
  • 18לייקים

מה זה

מדובר בגרסה לא רשמית של קורפוס Common Voice 17 מבית מוזילה, שהורדה מהאתר שלהם והומרה למבנה שמתאים לספריית datasets. המאגר מכיל מעל אלפיים קובצי ארכיון של אודיו ומחולק לשפות שונות, בהן אבחזית, אפריקאנס, אמהרית, ערבית, אסאמית, אזרית, בנגלית ואחרות.

כל רשומה כוללת נתיב לקובץ שמע ואת משפט הטקסט התואם לו. לצד הטקסט והאודיו, הרשומות כוללות שדות מטא-דאטה כמו מזהה לקוח, מבטא, גיל, מגדר, אזור, פלח שמע, וכן הצבעות חיוביות ושליליות שמשמשות לסינון ובקרת איכות.

החלוקה הפנימית בתוך כל שפה כוללת סטים של אימון, פיתוח ומבחן, לצד תיקיות ייעודיות להקלטות שנפסלו או סווגו תחת קטגוריות אחרות. זה מאפשר לבחור ישירות אם לעבוד רק עם דגימות מאומתות או לבחון גם הקלטות בעייתיות יותר.

מתאים ל

  • אימון מודלי תמלול

    אימון של מודלי זיהוי דיבור אוטומטי על שפות נתמכות באמצעות הקלטות תואמות טקסט.

  • הערכת ביצועי שמע

    מבחן ביצועים למודלים קיימים באמצעות חלוקת המבחן המובנית בשפות השונות.

  • בדיקת מבטאים וגילאים

    ניתוח דיוק המודל לפי פלחי גיל, מגדר ומבטא על בסיס המטא-דאטה שנאסף ברשומות.

איפה זה נופל

הכרטיס מצהיר על גרסה לא רשמית, ולכן תאימות מלאה מול שחרורים מקוריים של מוזילה מחייבת בדיקה זהירה מצדכם. בנוסף, רשימת השפות המפורטת במידע כוללת שפות ספציפיות כמו ערבית ואמהרית, אך עברית אינה מופיעה ברשימת השפות שסופקה. איכות ההקלטות משתנה מאוד בין תורמים, ולפני שמכניסים דגימות לאימון כדאי להסתמך על נתוני ההצבעות כדי לנפות רעשים והקלטות שאינן תואמות את הטקסט.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא נחלת הכלל cc0-1.0. משמעות הדבר היא שאין מגבלות מסחריות על השימוש בנתונים. אפשר לאמן עליהם מודלים פנימיים או מוצרים שנמכרים ללקוחות בלי לחשוף קוד.

האם המאגר כולל תמיכה בעברית?

רשימת השפות המדווחת עבור המאגר הזה כוללת קודים כמו ab, af, am, ar, bn ואחרים, אך הקוד he אינו מצוין בה. אם אתם מחפשים לאמן מודל בעברית, המאגר המסוים הזה כפי שהועלה אינו כולל אותה. תצטרכו לחפש מקור אחר עבור הקלטות בעברית.

כמה המאגר שוקל ואיך מומלץ להוריד אותו?

המאגר מכיל 2,152 קבצים ומספר רשומות עצום בטווח של מאות מיליארדים. הורדה מלאה של כל הקבצים למחשב מקומי עשויה לדרוש נפח אחסון חריג ורוחב פס משמעותי. מומלץ להוריד קונפיגורציה של שפה ספציפית או להשתמש במצב הזרמה כדי למנוע צוואר בקבוק בדיסק.

מה ההבדל בין המאגר הזה לשחרור הרשמי של מוזילה?

מדובר בהעלאה עצמאית של המשתמש fsicoli ולא בחשבון הרשמי של מוזילה. הקבצים נלקחו מאתר הפרויקט והומרו כך שיתאימו לטעינה ישירה בפייתון. המבנה כולל מטא-דאטה זהה למקור אך מוגש בצורה שנוחה יותר לשילוב בספריות קוד מודרניות.

איך טוענים

טוענים את הנתונים דרך פונקציית load_dataset ומציינים את קוד השפה הרצוי ואת החלק, למשל train. אין צורך בבקשת גישה מיוחדת, והמאגר פתוח להורדה ישירה. בגלל שמדובר באלפי קבצים ובנפח עצום של קובצי tar, מומלץ להפעיל מצב הזרמה עם פרמטר ייעודי, במיוחד אם אתם רק בודקים את המבנה או מאמנים מודל ישירות ברשת בלי להוריד את כל המידע לכונן המקומי.

from datasets import load_dataset

ds = load_dataset("fsicoli/common_voice_17_0")

הרישיון

המאגר מפורסם תחת רישיון נחלת הכלל cc0-1.0. הרישיון מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי והפצה, בלי חובת ייחוס ובלי דרישה לשתף מודלים מאומנים באותו רישיון. למרות זאת, כותבי המאגר מצרפים ציטוט אקדמי למי שמשתמש בו למחקר.

הרישיון המלא ב־Hugging Face ↗