GPT
W

whisper-base-ar-quran

קוד פתוח

tarteel-aiapache-2.02022-12-08

  • transformers
  • pytorch
  • tensorboard
  • whisper
  • automatic-speech-recognition

התאמה ייעודית של מודל קול קטן לתמלול קריאת קוראן בערבית. הוא מיועד למי שצריך זיהוי מדויק של טקסט דתי ספציפי בלי להחזיק שרתים כבדים.

  • 279 MBמשקל הקבצים
  • 15,936הורדות בחודש
  • 181לייקים
  • 6שכבות

מה זה

מדובר בכיוונון של whisper-base מבית OpenAI על הקלטות של קוראן. הגרסה המקורית של המודל מתקשה לעיתים קרובות עם הגייה מסורתית, טעמי מקרא ומשקלים קלאסיים בערבית, וכאן החליטו לאמן אותו נקודתית על התחום הזה. המודל שוקל 279 מגה בייט בלבד, כך שמדובר בכלי זעיר במונחים של תמלול דיבור.

לפי הנתונים שהמפתחים פרסמו, שיעור טעויות המילים שלו עומד על 5.75% במבחן ההערכה. בשביל מודל קטן כל כך, זו תוצאה יפה מאוד שמראה שהוא מצליח לתפוס את רוב המילים בדיוק גבוה, כל עוד מדובר בטקסט הקוראני שעליו הוא כוון.

מתאים ל

  • אפליקציות לימוד קוראן

    זיהוי קריאה ותרגול הגייה של פסוקים ישירות על מכשיר המשתמש ללא צורך בחיבור לרשת.

  • אינדוקס שיעורי דת

    חיפוש מילים וקטעים מתוך הקלטות שמע שכוללות ציטוטים מדויקים מתוך הקוראן.

  • תמלול קול במכשירי קצה

    הפעלת מודל קל משקל של פחות מ־300 מגה בייט בסביבות עבודה ללא מעבד גרפי.

איפה זה נופל

הבעיה המרכזית היא חוסר תיעוד מוחלט בכרטיס המודל. לא מפורט על איזה דאטה הוא אומן, מי הקריינים, או מה היו תנאי ההקלטה. בנוסף, הוא כוונן ספציפית לקוראן, מה שאומר שהוא כנראה יקרוס או ימציא מילים אם תנסו לזרוק עליו ערבית מדוברת, ניבים מקומיים או חדשות בערבית סטנדרטית. אסור לבנות עליו למשימות תמלול כלליות בלי לבדוק אותו קודם על ההקלטות שלכם.

שאלות
נפוצות

האם הוא יתמלל שיחות בערבית מדוברת?

לא. המודל עבר כיוונון ממוקד לקריאת קוראן, ולכן הוא רגיל למבנה טקסט, אוצר מילים והגייה קלאסית. בערבית מדוברת או בניבים מקומיים הוא צפוי לטעות לעיתים קרובות.

האם חובה להשתמש בכרטיס מסך כדי להריץ אותו?

ממש לא. מדובר במודל בגודל בסיסי של 279 מגה בייט, ומעבד מודרני ממוצע יכול להריץ אותו בזמן אמת בלי בעיה.

איך מריצים

בגלל המשקל הנמוך שלו, אפשר להריץ אותו כמעט על כל מעבד רגיל, לפטופ פשוט או אפילו מכשירי קצה וטלפונים בלי להזדקק לכרטיס מסך ייעודי. העבודה נעשית ישירות דרך ספריית transformers הרגילה בפייתון, בקוד תמלול בסיסי.

אם אתם בונים שירות שצריך לעבד כמויות אדירות של שעות במקביל, כרטיס מסך בסיסי יסגור לכם את הפינה במהירות גבוהה מאוד. אין סיבה לשלם לספקי ענן על API חיצוני במקרה הזה, כי העלות של הרצה עצמית כאן שואפת לאפס.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="tarteel-ai/whisper-base-ar-quran")
print(pipe("שלום"))

הקבצים

42 קבצים במאגר, 279 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי לחלוטין. אפשר לשלב אותו במוצר, לשנות את הקוד ולהפיץ אותו בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗