GPT
J

japanese-anime-speech

קוד פתוח

joujiboicc0-1.02023-11-07

  • anime
  • japanese
  • 日本語
  • nihongo
  • speech

המאגר כולל עשרות אלפי קטעי קול ותמלולים ממשחקי Visual Novels ביפנית. הוא מתאים למי שרוצה לדייק מודלי זיהוי דיבור על עולם האנימה, שבו סגנון הדיבור שונה מאוד מיפנית רגילה.

  • 865הורדות בחודש
  • 160לייקים

מה זה

הנתונים מורכבים מ־73,004 צמדים של שמע ותמלול באורך ממוצע של 5.4 שניות לקטע, שמצטברים לכ־110 שעות דיבור ביפנית. כל החומר הוקלט במקור עבור שמונה כותרי Visual Novels שונים. הדאטהסט עבר חמישה סבבי עדכון, שבהם המפרסם הוסיף כותרים, המיר את הקבצים מפורמט wav ל־mp3, וניקה תווים חריגים בתחילת שורות ובסופן.

תהליך הניקוי התמקד בסינון קבצים באיכות נמוכה, הסרת קולות רקע שאינם מילים, וצמצום קטעי תוכן בוגר. בנוסף, התמלולים עברו עריכה כדי להיפטר מרצפים ארוכים של תווים חוזרים ומוגזמים שנפוצים בטקסטים דרמטיים, כדי לייצר טקסט עקבי יותר לאימון.

מתאים ל

  • אימון Whisper לתכני אנימה

    כיוונון מודלי זיהוי דיבור כדי שיתמודדו טוב יותר עם אינטונציות חריגות וסגנון דרמטי.

  • בדיקת מודלים על דיבור אולפן

    מבחן ביצועים למערכות תמלול יפנית על קולות נקיים יחסית מהפרעות ורעשי רקע.

  • מחקר בלשני על מדיה מצוירת

    ניתוח התאמה בין תסריטים מוקלטים לטקסט כתוב בז'אנר הרומנטי והפנטסטי.

איפה זה נופל

ההקלטות נלקחו כולן ממשחקי Visual Novels, ולכן יש בהן הטיה מובהקת לקולות נשיים ולאוצר מילים מוגבל סביב יחסים, רומנטיקה ופנטזיה. הדיבור מוקלט באולפן מקצועי, ברור ואיטי יותר משיחה טבעית ברחוב, כך שהוא לא יעזור לכם במיוחד אם אתם מחפשים לזהות דיבור יפני יומיומי, ספונטני או מקוטע. מעבר לזה, המאגר כולו ביפנית בלבד ואין בו שום תוכן בעברית. למרות ניסיונות הסינון, המפרסם עצמו מזהיר שחלק מההקלטות עשויות להכיל רמיזות מיניות או נושאים למבוגרים.

אותה משפחה

japanese-anime-speech יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. הרישיון הוא cc0-1.0, כך שאפשר לאמן עליו מודלים מסחריים ללא תשלום תמלוגים. היוצר מבקש קישור וקרדיט אם זה מתאפשר, אבל אין לכך דרישה חוקית.

האם יש במאגר תמיכה בעברית או תרגום?

לא. כל 73,004 ההקלטות והתמלולים הם ביפנית בלבד. אין שום תוכן, שדות או תרגומים בעברית או באנגלית בתוך קובצי הנתונים.

מאיפה הגיעו קובצי השמע?

הנתונים נאספו משמונה משחקי Visual Novels שונים. הם עברו המרה לפורמט mp3 וסינון שנועד להוציא קטעים בוטים במיוחד, צלילים שאינם מילים וקטעים באיכות נמוכה.

האם הדאטהסט מתאים לאימון זיהוי שיחות רחוב ביפנית?

ממש לא. מדובר במדבבים מקצועיים שמקריאים תסריטים לאנימה ומשחקים בצורה איטית וברורה. הדיקציה האולפנית ואוצר המילים המוגזם לא מייצגים שפה מדוברת אמיתית.

איך טוענים

הנתונים פתוחים להורדה ישירה ללא צורך באישור גישה. סט האימון מחולק ל־22 קובצי parquet, מ־train-00000-of-00021 עד train-00021-of-00021, לצד קובץ טקסט בשם audio_transcription_list.txt שמכיל את רשימת ההקלטות והתמלולים. לפני הטעינה כדאי לקחת בחשבון שמדובר ב־110 שעות שמע דחוסות ב־mp3, כך שפריסה ועיבוד של עשרות אלפי קטעים דורשים מקום פנוי בדיסק וזיכרון עבודה מתאים.

from datasets import load_dataset

ds = load_dataset("joujiboi/japanese-anime-speech")

הרישיון

המאגר מפורסם תחת רישיון cc0-1.0, שמשמעותו נחלת הכלל. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו, לאמן עליו מודלים ולהפיץ יצירות נגזרות בלי חובת שיתוף באותו רישיון. מתן קרדיט עם קישור אינו חובה לפי הרישיון, אף שהיוצר מבקש זאת, והוא מצהיר שאינו נושא באחריות לתוצאות השימוש במידע.

הרישיון המלא ב־Hugging Face ↗