GPT
W

WaxalNLP

קוד פתוח

googlecc-by-sa-4.0,cc-by-4.02026-01-19

  • audio
  • automatic-speech-recognition
  • text-to-speech

מאגר קול וטקסט רחב לשפות אפריקאיות, שמיועד לאימון מודלי תמלול והקראה. הוא מספק מענה נדיר לחוקרים ומפתחים שמחפשים דאטה פתוח לשפות עם מעט מאוד משאבים קיימים.

  • 15,468הורדות בחודש
  • 278לייקים

מה זה

המאגר מרכז הקלטות אודיו יחד עם תמלולים ידניים ותיוגי המונים בעשרות שפות אפריקאיות מקומיות, ביניהן אמהרית, האוסה, איגבו, אורומו, סוואהילי וטיגריניה. הרשומות מבוססות על מקורות קודמים כמו UGSpeechData ו־AfriVoice לצד דאטה מקורי נוסף. כל רשומה כוללת מזהה ייחודי, מזהה דובר, מגדר, קובץ שמע, וכן טקסט מתאים לתמלול או להקראה בהתאם למשימה.

הנתונים מחולקים לתצורות מוגדרות מראש עבור כל שפה בנפרד, ומתפצלים בין שתי משימות עיקריות: זיהוי דיבור אוטומטי והמרת טקסט לדיבור. בחלק ממערכי התמלול קיים פיצול מקובל של אימון, ולידציה ובדיקה, לצד פיצול של שמע ללא תיוג שמיועד ללמידה בחצי פיקוח. בחלק מהשפות קיימות גם גרסאות מעודכנות של מערכי התמלול תחת סימון גרסה ייעודי.

מתאים ל

  • אימון זיהוי דיבור

    פיתוח מודלי תמלול קולי לשפות אפריקאיות מקומיות תוך שימוש בקבצי השמע והטקסט המתועדים.

  • פיתוח מנועי הקראה

    אימון מערכות שממירות טקסט כתוב לקול טבעי בשפות כמו יורובה, סוואהילי או האוסה.

  • למידה בחצי פיקוח

    אימון מקדים של מודלי שמע על גבי מאגרי ההקלטות הלא מתוייגים שקיימים בחלק מהשפות.

איפה זה נופל

הנתונים נשענים על מקורות חיצוניים ועל תיוג המונים, מה שעלול לייצר חוסר אחידות באיכות ההקלטות ורמות רעש משתנות בין הדגימות. הדאטהסט מוגבל לשפות אפריקאיות ספציפיות ולא כולל עברית, אנגלית או שפות אירופאיות אחרות. חלק מהתצורות מציעות רק משימת תמלול או רק משימת הקראה, ולכן אי אפשר לבנות צינור קולי דו כיווני מלא בכל שפה שנמצאת במאגר. חובה לסנן ולבדוק את דיוק התמלולים לפני שמבססים עליהם מערכת קריטית.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

הרישיונות המדווחים מאפשרים שימוש מסחרי עם מתן ייחוס מתאים. יחד עם זאת, בגלל הרישיון מסוג שיתוף זהה, כל מוצר או מודל שנגזר ישירות מהחלקים הרלוונטיים יידרש להיפתח תחת אותו רישיון חופשי.

האם יש בדאטהסט נתונים בעברית?

לא, המאגר מוקדש כולו לשפות מאזור אפריקה ואינו מכיל עברית כלל. הוא רלוונטי רק למי שבונה פתרונות קוליים לשפות אלה או חוקר מודלים רב לשוניים.

איך המידע נאסף ועובד?

הנתונים נשענים על פרויקטים קיימים כמו AfriVoice ו־UGSpeechData לצד איסוף מקורי נוסף. חלק גדול מתהליך התיוג התבסס על עבודת המונים ותיוג אנושי ייעודי.

האם צריך להוריד את כל המאגר בבת אחת?

ממש לא, וגם לא מומלץ לעשות את זה. המאגר מפוצל לעשרות תצורות שונות לפי שפה ומשימה, כך שניתן לטעון רק את השפה והמשימה שמעניינות אתכם.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות ציון המזהה של המאגר ובחירת התצורה המתאימה לשפה ולמשימה הרצויה, למשל תמלול באמהרית או הקראה בסוואהילי. אין צורך בבקשת גישה מיוחדת להורדה. הקבצים מנוהלים בפורמט Parquet, וכדאי לקחת בחשבון שהמאגר כולל 2,619 קבצים עם דאטה קולי, כך שטעינה מלאה של כל התצורות דורשת רוחב פס ניכר ושטח אחסון מקומי משמעותי.

from datasets import load_dataset

ds = load_dataset("google/WaxalNLP")

הרישיון

המאגר מדווח תחת רישיונות כפולים של Creative Commons, הכוללים את CC-BY 4.0 ואת CC-BY-SA 4.0. המשמעות היא שמותר להשתמש בדאטהסט לפרויקטים מסחריים ומחקריים בכפוף למתן קרדיט מתאים ליוצרים. עם זאת, רכיבים שמכוסים תחת רישיון שיתוף זהה מחייבים הפצה של כל יצירה נגזרת או מודל שמתבסס עליהם ישירות תחת אותם תנאי רישיון בדיוק.

הרישיון המלא ב־Hugging Face ↗