GPT
A

ASCEND

קוד פתוח

CAiREcc-by-sa-4.02022-03-02

  • speech-recognition
  • code-switching

הקלטות שיחה חופשית בהונג קונג המשלבות סינית ואנגלית באותו המשפט. זה מיועד למי שבונה זיהוי דיבור למצבי מעבר שפה ולא מסתפק בדיבור מלאכותי ומוקרא.

  • 1,462הורדות בחודש
  • 53לייקים

מה זה

המאגר כולל 10.62 שעות של דיבור ספונטני ורב שיח, עם כ־12.3 אלף היגדים בסך הכל. ההקלטות נאספו בהונג קונג ומייצגות תופעה שבה דוברים מחליפים בין סינית ואנגלית תוך כדי שיחה שוטפת.

כל רשומה מכילה את קובץ השמע, מערך הדגימות בתדר של 16 קילוהרץ, ותמלול טקסטואלי מלא. בנוסף יש מטא דאטה שכולל מזהה דובר מקורי, מזהה שיחה, משך ההקלטה בשניות, שפת ההיגד ונושא השיחה.

הנתונים מחולקים לשלושה חלקים ביחס של שמונה לאחד לאחד, עם איזון מגדרי בין החלקים. סט האימון מכיל 9,869 היגדים, סט הוולידציה כולל 1,130, ובסט הבדיקה יש 1,315 היגדים.

מתאים ל

  • אימון זיהוי דיבור מעורב

    התאמת מודלים לזיהוי דיבור שמתמודדים עם מעבר בין אנגלית לסינית באותו משפט.

  • הערכת ביצועי מודלים

    בדיקת עמידות של מנועי תמלול מול שפה ספונטנית שאינה מוקראת מטקסט.

  • חקר מעבר שפות בשיחה

    ניתוח בלשני ואלגוריתמי של דפוסי החלפת שפה בתוך דיאלוגים מרובי משתתפים.

איפה זה נופל

ההקלטות מוגבלות לאנגלית וסינית בלבד ואינן כוללות עברית או שפות אחרות. נפח הדאטה קטן יחסית ועומד על קצת יותר מעשר שעות, מה שהופך אותו ללא מתאים לאימון מלא של מודל מודרני מאפס. החומר משקף דפוסי דיבור ומבטא ספציפיים להונג קונג, כך שלא בטוח שהוא יעבוד טוב על דוברים מאזורים אחרים. המאגר פורסם במרץ 2022 והכרטיס אינו מפרט רשימת הטיות מעבר לכך.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

הרישיון מאפשר שימוש מסחרי, אך הוא כולל דרישת שיתוף זהה. כל שינוי או נגזרת שתפיצו יחייבו שחרור תחת אותו רישיון חופשי, מה שעשוי להוות בעיה לקוד קנייני סגור.

האם יש במאגר תמיכה בעברית?

אין במאגר עברית כלל. הנתונים מורכבים אך ורק משילוב של אנגלית וסינית שנאספו בהונג קונג.

האם הדאטהסט מספיק כדי לאמן מודל מאפס?

המאגר מכיל עשר שעות וחצי של אודיו בלבד, ולכן הוא לא יספיק לבניית מודל זיהוי קולי חדש. הוא מתאים בעיקר לכיוונון עדין של מודל קיים או כסט מבחן לבדיקת ביצועים.

איך אספו את ההקלטות?

החומר הוקלט במסגרת שיחות ספונטניות מרובות משתתפים שנערכו בהונג קונג לפי נושאים שונים. הדגש באוסף היה לתפוס דיאלוג אמיתי וחופשי שבו משלבים את שתי השפות בטבעיות.

איך טוענים

טוענים את המאגר ישירות בעזרת הספרייה datasets דרך הפקודה הרגילה, ללא צורך בבקשת גישה מיוחדת או אישור מראש. הנתונים מאוחסנים בשבעה קבצים, כולל קובצי פרקט שמחולקים לפי הסטים השונים. השדות העיקריים לעבודה הם שדה השמע עצמו והתמלול, לצד משך הזמן שמאפשר סינון לפי אורך קטעים.

from datasets import load_dataset

ds = load_dataset("CAiRE/ASCEND")

הרישיון

המאגר מופץ תחת רישיון שיתוף זהה CC BY-SA 4.0. הרישיון מתיר שימוש מסחרי, אך מחייב מתן קרדיט ליוצרים. המלכוד העיקרי הוא סעיף השיתוף הזהה, שמחייב אתכם לשחרר כל יצירה נגזרת תחת אותו הרישיון בדיוק, וזה עלול להגביל שילוב שלו במודלים מסחריים קנייניים וסגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗