GPT
Q

Quran-Recitations

קוד פתוח

MohamedRashadרישיון לא דווח2025-03-30

המאגר מרכז הקלטות קוליות של פסוקי קוראן לצד הטקסט המנוקד שלהם. הוא מיועד למי שבונה מודלים לזיהוי דיבור או סינתזה קולית בערבית קלאסית עם דגש על כללי הגייה מדויקים.

  • 324הורדות בחודש
  • 63לייקים

מה זה

המאגר כולל בין מאה אלף למיליון רשומות, שכל אחת מהן מחברת בין קובץ שמע של פסוק לבין הטקסט התואם שלו. הטקסט כולל ניקוד וסימני תשכיל מלאים במטרה לשמור על אופן ההגייה המקורי. לצד הטקסט והשמע, כל רשומה מציינת את שמו של הקורא שהקליט אותה.

מקור המידע הוא ה־API של AlQuran Cloud, שדרכו נמשכו קובצי האודיו והטקסטים. המאגר מכיל הקלטות של שורה ארוכה של קוראים ידועים, ביניהם עבד אל-באסט עבד א-סמד, מחמוד ח'ליל אל-חוסרי, משארי אל-עפאסי ואימן סוויד, בחלקם בסגנונות קריאה שונים כמו מורתל ומג'ווד. הכרטיס לא מפרט תהליכי סינון, ניקוי או חלוקה מוגדרת מראש לסטים של אימון ובדיקה.

מתאים ל

  • זיהוי דיבור בערבית קלאסית

    אימון מודלים להמרת קול לטקסט תוך שמירה על ניקוד מלא וכללי הגייה של טקסטים דתיים.

  • סינתזת דיבור של פסוקים

    בניית מודלי טקסט לקול המסוגלים לקרוא פסוקים בסגנון הקריאה המסורתי.

  • זיהוי קול של קוראים

    אימון מודל סיווג שמע שמזהה איזה קורא מבצע את ההקלטה מתוך שדה המקור.

איפה זה נופל

הנתונים מוגבלים לחלוטין לשפה הערבית, ובאופן ספציפי לערבית קוראנית קלאסית. לא תמצאו כאן שפות אחרות, אין כאן עברית, ואין שום ייצוג לערבית מדוברת או לניבים מודרניים. בנוסף, חיתוך השמע נעשה ברמת הפסוק, והכרטיס אינו מספק מידע לגבי חלוקה מובנית לסט אימון, בדיקה ואימות, כך שתידרשו לבצע פיצול עצמאי שמונע זליגת דוברים בין הסטים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הכרטיס מציין שהרישיון אינו מדווח, ולכן אין הרשאה רשמית להשתמש בחומרים למטרות מסחריות. שימוש במידע כזה במוצר מסחרי עלול להפר זכויות יוצרים, במיוחד כשמדובר בהקלטות קוליות שנמשכו משירות חיצוני.

האם יש במאגר טקסטים בעברית או תרגומים?

לא. המאגר כולו מוגדר בערבית בלבד. הטקסטים הם פסוקי קוראן בערבית קלאסית עם סימני תשכיל, ואין בו שום נתונים בעברית.

איך נאספו הנתונים?

היוצר משך את קובצי השמע והטקסט ישירות מתוך הממשק של AlQuran Cloud API. הנתונים שומרים על ההקשר שבין הקורא, הפסוק והשמע כפי שהם מסופקים בממשק המקורי.

מה מבנה הקבצים שצריך להוריד?

המאגר מורכב ממאה קובצי Parquet שונים שמחזיקים את כל הרשומות, לצד קובץ הסבר. אין חלוקה מובנית מראש לקובצי אימון ומבחן נפרדים, וכל הקבצים נקראים תחת שמות train ממוספרים.

איך טוענים

הנתונים מחולקים למאה קובצי Parquet שונים שיושבים תחת תיקיית המידע. טוענים אותם באמצעות ספריית datasets הרגילה של Hugging Face, ללא צורך בהרשאת גישה מיוחדת או אישור מיוצר המאגר. הרשומות כוללות שלושה שדות בלבד: שדה source עם שם הקורא, שדה text המכיל את הפסוק המנוקד, ושדה audio שמחזיק את קובץ השמע.

from datasets import load_dataset

ds = load_dataset("MohamedRashad/Quran-Recitations")

הרישיון

ליוצר המאגר אין רישיון מדווח בכרטיס. בפועל, המשמעות היא שאין הרשאה מפורשת לשימוש מסחרי, להפצה מחדש או לאימון מודלים פתוחים וסגורים. כל שימוש בנתונים אלה לצורך אימון מוצר מסחרי חושף אתכם לסיכון משפטי, שכן זכויות היוצרים על ההקלטות והשירות שממנו נמשכו אינן מוסדרות.

הרישיון המלא ב־Hugging Face ↗