GPT
Z

zoengjyutgaai

קוד פתוח

CanCLIDcc0-1.02024-07-11

  • cantonese
  • audio
  • art

מעל מאה ושמונים שעות של סיפורי עם וספרות בקנטונזית, מוקלטים בקולו של מספר יחיד. המאגר נותן קול אחיד ואיכותי לצורכי זיהוי דיבור או סינתזה קולית ברישיון חופשי לחלוטין.

  • 6,494הורדות בחודש
  • 30לייקים

מה זה

המאגר מכיל קטעי אודיו קצרים שמלווים בתעתיק טקסטואלי מלא, כולם בקולו של מספר הסיפורים והשחקן ג'אנג יואקאי (Zoeng Jyut Gaai). ההקלטות חולקו לארבע יצירות שונות: רומן שלוש הממלכות (saamgwokjinji), שפת המים (seoiwuzyun), ימיו האחרונים של מאו דזה-דונג (mouzaakdung), והרומן לוק דינג גיי (lukdinggei). אורך קטע ממוצע עומד על כחמש נקודה שמונה שניות, וסך הכל ישנם כשני נקודה תשעה מיליון תווים סיניים.

מקור החומרים בקובצי אודיו ורשת מיוטיוב ומאתרי סיפורים סיניים, שחולקו במקור לפרקים של חצי שעה בפורמטי mp3 או webm. היוצרים הצמידו להם כתוביות srt, המירו את האודיו לפורמט opus בקצב דגימה של 48000 הרץ, וחתכו את הקטעים למשפטים בודדים באמצעות תסריט ייעודי. הטקסטים עברו סטנדרטיזציה קפדנית של כתיב קנטונזי, ללא ספרות ערביות, ללא אותיות לטיניות ועם סימני פיסוק ברוחב מלא בלבד.

מתאים ל

  • אימון מודלי הקראה (TTS)

    בניית מודל קול סינתטי יציב ואחיד בקנטונזית על בסיס קולו של מספר מקצועי יחיד.

  • אימון ובדיקת זיהוי דיבור

    שימוש בתעתיקים המדויקים לטובת מודלי ASR ממוקדים לקנטונזית נקייה ומדויקת.

  • מחקר בלשני וספרותי

    ניתוח אקוסטי, משקלי דיבור ומבנים תחביריים של אמנות הסיפור העממי של גואנגג'ואו.

איפה זה נופל

זהו מאגר עם דובר יחיד, זכר ומבוגר, כך שהוא לא מתאים לאימון מודל זיהוי דיבור כללי שצריך להתמודד עם מגוון קולות, מבטאים ומגדרים. השפה בלעדית לקנטונזית (yue) בסגנון דיבור מסורתי ותיאטרלי, ללא מילים שאולות באנגלית או מספרים. אין במאגר עברית בכלל, והטקסט אינו מייצג שיחות יומיומיות מודרניות אלא הגשת סיפורים היסטוריים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא CC0 1.0, שמקביל לנחלת הכלל ומשחרר את המידע ללא הגבלות מסחריות, ללא צורך ברישוי מיוחד וללא חובת קרדיט חוקית.

האם יש במאגר נתונים בעברית?

לא. כל ההקלטות והתעתיקים הם אך ורק בקנטונזית, ללא מילים באנגלית, ללא ספרות וללא שפות נוספות.

כמה שטח אחסון נדרש לעבודה עם הקבצים?

הקבצים שמורים כברירת מחדל בפורמט opus דחוס שאינו שוקל הרבה. אם תבחרו להמיר את כל ההקלטות לפורמט wav ללא דחיסה לצורך אימון, תצטרכו להכין לפחות 500 גיגה-בייט בכונן.

האם המאגר מתאים לאימון זיהוי קולי למוקדי שירות או שיחות יום-יום?

לא מומלץ. מדובר במספר סיפורים בודד שמקריא ספרות קלאסית בסגנון רדיופוני תיאטרלי, ולכן המודל לא ילמד סלנג, רעשי רקע של שיחה או מגוון רחב של דוברים.

איך טוענים

טוענים את המאגר ישירות בספריית datasets עם הקריאה CanCLID/zoengjyutgaai ללא צורך באישור גישה מראש. האודיו עצמו דחוס בפורמט opus, אך אם ממירים אותו לקובצי wav מקומיים באמצעות התסריט המצורף, יש להכין לפחות 500 גיגה-בייט של מקום אחסון פנוי. הנתונים מחולקים לפי ארבעת הסיפורים, וכוללים קטעי אודיו ותעתיקי טקסט בסימניות סיניות.

from datasets import load_dataset

ds = load_dataset("CanCLID/zoengjyutgaai")

הרישיון

המאגר שוחרר ברשות הרבים תחת רישיון CC0 1.0 Universal. מותר להשתמש בו לכל מטרה, כולל שימוש מסחרי מלא, שינוי ואימון מודלים, בלי חובת ייחוס ובלי דרישה לשתף תוצרים באותו רישיון. היוצרים רק מבקשים לתת קרדיט כמחווה למספר, אך זו אינה חובה משפטית.

הרישיון המלא ב־Hugging Face ↗