GPT
E

everyayah

קוד פתוח

tarteel-aimit2022-12-07

הקלטות שמע של פסוקי קוראן לצד תמלול ערבי מלא ומנוקד. זה המאגר שאתם צריכים אם המטרה היא זיהוי דיבור קלאסי, דתי או מנוקד ברמת דיוק גבוהה.

  • 2,083הורדות בחודש
  • 42לייקים

מה זה

המאגר מציג הקלטות קוליות של פסוקי קוראן שנקראים על ידי קריינים שונים, ומשודכים לטקסט תואם בערבית עם ניקוד מלא. מדובר במאות אלפי רשומות שמספקות בסיס נרחב לאימון מודלים של זיהוי דיבור, בדגש על הגייה מוקפדת של השפה הערבית הקלאסית.

כל שורת מידע כוללת ארבעה שדות מרכזיים: אובייקט שמע המכיל את המערך הדחוס וקצב דגימה של 16 קילוהרץ, שדה טקסט עם הפסוק המנוקד, שדה משך זמן בשניות, ושם הקריין המבצע. הנתונים מחולקים כבר ברמת המקור לשלושה חלקים מוכנים לעבודה: 187,785 דגימות לאימון, 23,473 לבדיקה, ועוד 23,474 לוולידציה.

הכרטיס הרשמי שפרסמו Tarteel AI דל מאוד בפרטים לגבי אופן הסינון, מקורות האודיו המקוריים או הדרך שבה נחתכו ההקלטות והוצמדו לטקסט. המידע הקיים מציג בעיקר את המבנה הטכני הסופי ואת החלוקה לחלקים, בלי לפרט על תהליכי הנרמול או אבטחת האיכות שבוצעו בפועל.

מתאים ל

  • זיהוי דיבור בערבית קלאסית

    אימון ובדיקה של מודלי תמלול על קריאה מנוקדת בדיוק גבוה.

  • הערכת הגייה דתית

    בניית כלים לבדיקת דיוק קריאה ושינון פסוקים מול קריינים מוכרים.

  • הוספת ניקוד אוטומטי

    כיול מודלים שממירים שמע ישירות לטקסט ערבי הכולל תשכיל מלא.

איפה זה נופל

השפה היחידה כאן היא ערבית, ובאופן ספציפי ערבית קוראנית קלאסית עם חוקי קריאה מוגדרים. אין פה דיאלקטים מקומיים, סלנג או שפת יום יום, כך שלאימון מודל קולי כללי למזרח התיכון הוא לא יתאים לבדו. בנוסף, הכרטיס לא מספק שום מידע על הטיות גיל, מגדר או רקע של הקריינים, ולא מתעד באילו מכשירי הקלטה נעשה שימוש, מה שמחייב אתכם לבדוק את איכות האות בעצמכם לפני שימוש במוצר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. תיוג המאגר הוא תחת רישיון MIT שמאפשר שימוש מסחרי חופשי, אם כי הכרטיס מזכיר גם ייחוס לפי קריאייטיב קומונס. בכל מקרה שתי האפשרויות אינן חוסמות שימוש מסחרי, אך יש להקפיד על מתן קרדיט ליוצרים.

האם יש במאגר הקלטות בעברית או בשפות אחרות?

לא. כל הנתונים במאגר הם בשפה הערבית בלבד, ומבוססים על קריאת פסוקי קוראן. אין בו תוכן בעברית או תרגומים לשפות נוספות.

מה המשקל וההיקף של הנתונים שצריך להוריד?

המאגר כולל מעל 234 אלף רשומות בסך הכל שמתפרסות על פני 159 קבצים, בעיקר בפורמט פרקט. מדובר בנפח אחסון גדול של קובצי שמע, ולכן כדאי להוריד רק את החלקים הנחוצים לכם.

מאיפה נלקחו ההקלטות ואיך אימתו אותן?

כרטיס הדאטהסט לא מפרט את מקור קובצי השמע, זהות הקריינים מעבר לשמם, או את תהליך בקרת האיכות. מי שמשתמש בחומרים צריך לבצע דגימה עצמאית כדי לוודא שאיכות השמע וההתאמה לטקסט עומדות ברף הנדרש.

איך טוענים

הנתונים יושבים במאגר בפורמט פרקט ומחולקים לעשרות קבצים, כולל 13 קובצי בדיקה שונים. אין צורך לבקש אישור גישה מיוחד כדי להוריד אותם. בזמן טעינה בקוד, חשוב לגשת קודם לאינדקס של השורה ורק אז לשדה האודיו, אחרת פעולת הפענוח והדגימה מחדש לכל הרשומות תחנוק את הזיכרון ותאט את הריצה באופן קיצוני.

from datasets import load_dataset

ds = load_dataset("tarteel-ai/everyayah")

הרישיון

המאגר מתויג ברישיון MIT, למרות שבגוף הטקסט של הכרטיס מופיע אזכור לרישיון קריאייטיב קומונס מסוג ייחוס. רישיון MIT מתיר שימוש מסחרי מלא, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים המקורית, ואינו מחייב אתכם לשתף את המודל המאומן תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗