GPT
O

omnilingual-asr-corpus

קוד פתוח

facebookcc-by-4.02025-10-30

מאגר ענק של הקלטות דיבור ותמלולים עבור מאות שפות ודיאלקטים נדירים מסביב לעולם. מיועד למי שבונה מודלי זיהוי דיבור או סיווג שמע וצריך כיסוי מעבר לשפות המרכזיות הרגילות.

  • 5,174הורדות בחודש
  • 210לייקים

מה זה

המאגר כולל בין מאה אלף למיליון רשומות שמיועדות למשימות זיהוי דיבור וסיווג שמע. כל רשומה מייצגת קטע דיבור מתועד, והנתונים מאורגנים לפי שפה ושיטת כתב בקבצי פרקט נפרדים. ברשימת השפות יש מאות קודים שונים, בעיקר שפות ילידיות, להגים אזוריים וניבים ערביים מגוונים.

החלוקה הפנימית בנויה לפי קונפיגורציות פרטניות לכל צמד של שפה וכתב, לצד תצורת ברירת מחדל שמאגדת את הכל. בחלק גדול מהשפות הנתונים מסודרים מראש לפיצולים של אימון, פיתוח ומבחן, אם כי בחלק מהשפות הדלות יותר זמין רק סט אימון בלבד ללא חלוקה מובנית לבדיקה.

כרטיס הנתונים שפרסמה פייסבוק אינו מפרט את מקורות ההקלטה המקוריים, מי הדוברים שהוקלטו או אילו תהליכי סינון, ניקוי ואימות עברו התמלולים. מדובר במבנה קבצים נקי ומוכן לעבודה, אבל בלי תיעוד על אופן איסוף האודיו בפועל בשטח.

מתאים ל

  • אימון זיהוי דיבור רב לשוני

    הרחבת מודלי שמע בסיסיים לתמיכה במאות ניבים אזוריים ושפות נדירות שאינן נתמכות במערכות מסחריות נפוצות.

  • סיווג שפות ולהגים

    בניית מסווג שמזהה מתוך קטע שמע קצר באיזו שפה או ניב מדובר, במיוחד בין להגים ערביים קרובים.

  • הערכת ביצועי מודלים

    בדיקת עמידות ודיוק של מערכות זיהוי דיבור קיימות על מגוון רחב של מבטאים ושפות דלות משאבים.

איפה זה נופל

החיסרון המרכזי הוא היעדר מוחלט של תיעוד לגבי איסוף האודיו, איכות ההקלטות או רמת הדיוק של הטקסט. עברית מודרנית לא נכללת במאגר, למעט יידיש או ניב ערבי יהודי באותיות עבריות. בנוסף, בחלק מהשפות אין סטים של ולידציה ומבחן, כך שתצטרכו לייצר חלוקה כזו בעצמכם. אי אפשר לדעת מהכרטיס אילו רעשי רקע קיימים והאם יש ייצוג מאוזן למגדרים וגילאים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון המדווח הוא קריאייטיב קומונס 4.0, שמתיר שימוש מסחרי מלא והפצה. הדרישה העיקרית היא מתן ייחוס מתאים לפייסבוק.

האם המאגר כולל עברית?

עברית רגילה אינה מופיעה ברשימת השפות. קיימים רק ניבים יהודיים ספציפיים באלפבית עברי או שפות קרובות כמו יידיש, לצד מבחר ניבים ערביים.

האם צריך להוריד את כל המאגר בבת אחת?

לא. המאגר מחולק לקונפיגורציות לפי שפה ושיטת כתב. מומלץ לטעון רק את התצורה של השפה הספציפית שמעניינת אתכם כדי להימנע מהורדת מאות קבצים מיותרים.

מאיפה הגיעו ההקלטות ומי אימת אותן?

כרטיס הדאטהסט אינו מציין את מקור ההקלטות או שיטות האימות. מומלץ לדגום ולהאזין לקבצים באופן ידני לפני שמשלבים אותם בתהליך אימון משמעותי.

איך טוענים

טוענים את הנתונים דרך ספריית הדאטהסטס של האגינג פייס ישירות לפי שם המאגר. המאגר כולל 1,473 קבצים בפורמט פרקט ואינו דורש אישור גישה מוקדם. אפשר לטעון את המאגר כולו דרך תצורת ברירת המחדל, אך כדי לחסוך זימן ותעבורת רשת מומלץ להגדיר קונפיגורציה של שפה ספציפית לפי קוד השפה ושיטת הכתב הרצויה.

from datasets import load_dataset

ds = load_dataset("facebook/omnilingual-asr-corpus")

הרישיון

המאגר מופץ תחת רישיון פתוח מסוג קריאייטיב קומונס 4.0. הרישיון מתיר שימוש מסחרי, מחקרי ושינוי של הנתונים, בתנאי שנותנים קרדיט מלא ומקשרים למקור. אין חובת שיתוף זהה, כך שניתן לאמן עליו מודלים מסחריים בלי לחשוף קוד או משקלים, בכפוף לשמירה על תנאי הייחוס.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗