GPT
D

dialectal-arabic-lahgtna-v2

קוד פתוח

oddadmixרישיון לא דווח2026-03-29

  • arabic
  • dialectal-arabic
  • speech
  • asr
  • dialect-identification

מעל שלושת אלפים שעות הקלטה של ערבית מדוברת ב־13 להגים שונים. התעתיק נשאר אותנטי למדוברת ולא נדחס לערבית ספרותית.

  • 7,097הורדות בחודש
  • 25לייקים

מה זה

המאגר כולל כ־611 אלף קטעי שמע מתועתקים של ערבית מדוברת, שמייצגים יותר מ־3,000 שעות דיבור. כל רשומה מחזיקה קובץ אודיו מונו באיכות 16kHz, תעתיק טקסטואלי ותגית להג. בין הלהגים אפשר למצוא פלסטיני, מצרי, לבנוני, סורי, עיראקי ולהגים מצפון אפריקה ומהמפרץ. הטקסט לא נורמל לערבית ספרותית (MSA), אלא שומר על האיות, אוצר המילים וניקוד חלקי של הלהג המדובר, לצד סימוני רעשים וקולות לוואי.

החלוקה הפנימית מפרידה בין אימון לבדיקה. חלק האימון מכיל 608,100 שורות, וחלק הבדיקה מבודד 3,100 שורות להערכת ביצועים. הכרטיס לא מפרט מה מקור ההקלטות ברשת, מי האנשים שדיברו שם, או איך נעשה הסינון בפועל לפני ההרכבה.

מתאים ל

  • אימון זיהוי דיבור בלהגים

    כיול מודלים כמו Whisper לזיהוי ערבית מדוברת אותנטית במקום ערבית ספרותית.

  • סיווג להגים מאודיו

    אימון מסווג שמזהה מאיזה אזור או מדינה הדובר לפי תגית השפה של הקטע.

  • בדיקת איכות של מודל קיים

    הרצת חלק ה־test שמכיל 3,100 דגימות כדי למדוד דיוק של מערכת תמלול קיימת.

איפה זה נופל

ההתפלגות בין 13 הלהגים לא מאוזנת בכלל, כך שחלקם מקבלים נפח גדול בהרבה מאחרים. בנוסף, התיוג נעשה ברמת הלהג הכללי בלבד, בלי שום חלוקה לתת-אזורים בתוך המדינות. כתיב של ערבית מדוברת אינו אחיד מטבעו, ולכן קיימים הבדלי כתיב ותעתיק בין דוגמאות שונות. הכרטיס לא מציין מתי בדיוק נאספו ההקלטות או מאילו מקורות, ואין בו שום נתונים בעברית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

היוצרים לא הגדירו רישיון בדף המאגר. בלי רישיון מפורש אין הרשאה חוקית לשימוש מסחרי, ומומלץ לפנות ישירות ליוצרים לפני שמשלבים אותו בצנרת מסחרית.

כמה מקום בדיסק צריך כדי להוריד את הכל?

חלק האימון שוקל כ־337 ג'יגה בייט בקובצי parquet שמחזיקים שמע דחוס. אם רוצים לפתוח את השמע ולעבוד עליו לוקאלית, יידרש נפח אחסון גדול בהרבה, ולכן היוצרים ממליצים לעבוד בסטרימינג.

האם יש במאגר דגימות בעברית או תעתיק עברי?

לא, המאגר כולל ערבית מדוברת בלבד, עם מקרים בודדים של מעבר לאנגלית או צרפתית שנכתבו בתעתיק. אין בו נתונים בעברית.

במה הוא שונה ממאגרי ערבית אחרים ברשת?

ההבדל המרכזי הוא שהתמלול שומר על הכתיב המדובר והפונטי של כל להג ולא מנרמל את המשפטים לערבית ספרותית. בנוסף, כל קטע מתויג לפי קוד הלהג שלו מתוך 13 אפשרויות.

איך טוענים

טוענים את המאגר ישירות עם Hugging Face datasets. אין פה צורך באישור גישה מיוחד, אבל חלק האימון לבדו תופס כ־337 ג'יגה בייט בקובצי parquet, מפוזר על פני 346 קבצים. אם אין לכם מקום פנוי ונפח עבודה עצום, עדיף להפעיל מצב סטרימינג ולא להוריד הכל מראש. המבנה פשוט: שדה audio, שדה transcript_text, ושדה language שמכיל את קוד הלהג באותיות לטיניות, למשל ps או eg.

from datasets import load_dataset

ds = load_dataset("oddadmix/dialectal-arabic-lahgtna-v2")

הרישיון

לא דווח רישיון עבור המאגר הזה. מבחינה משפטית, היעדר רישיון אומר שזכויות היוצרים שמורות למפרסמים ולא ניתנה רשות שימוש מוגדרת. אי אפשר לדעת אם מותר להשתמש בו לצרכים מסחריים, ואימון של מוצר מסחרי עליו מייצר סיכון משפטי ברור עד שהיוצרים יבהירו את תנאי השימוש.

הרישיון המלא ב־Hugging Face ↗