GPT
J

Japanese-Eroge-Voice-V2

קוד פתוח

NandemoGHSmit2026-01-14

  • speech
  • audio
  • voice
  • japanese
  • anime

מעל 2,600 שעות אודיו ביפנית ממשחקי מבוגרים, עם תמלול צמוד לכל קטע. המאגר מציע מעל מיליון דגימות קול עבור מודלים של דיבור שזקוקים למגוון סגנוני רחב.

  • 1,216הורדות בחודש
  • 50לייקים

מה זה

המאגר כולל 1,033,142 קטעי שמע יחד עם תמלול טקסטואלי, באורך כולל של כ־2,657 שעות. אורך ההקלטה הממוצע עומד על 9.259 שניות והחציון הוא 8.893 שניות. כל החומרים נשלפו ממשחקי מחשב יפניים למבוגרים, ללא חפיפה לגרסה הראשונה של הפרויקט, כך שכל הקטעים כאן חדשים לחלוטין.

כל רשומה מכילה את נתוני השמע, הטקסט, קצב הדגימה המקורי, ועמודה שמציינת את מקור התמלול. חלק מהתמלילים הגיעו ישירות מקובצי התסריט המקוריים של המשחקים, וחלקם נוצרו אוטומטית באמצעות מודל anime-whisper. כדי להקשות על שחזור המשחקים המקוריים, היוצרים ערבבו את הדגימות והחליפו את מזהי המשחק, הסצנה והדמות בערכי גיבוב אנונימיים.

מתאים ל

  • אימון מודלי הקראה

    אימון מודלים של סינתזת דיבור ביפנית בקולות נשיים ובסגנון משחקי מחשב ואנימה.

  • זיהוי דיבור ביפנית

    בדיקה ואימון של מערכות זיהוי דיבור אוטומטי על הקלטות בעלות גוון דיבור דרמטי ומשחקי.

  • מחקר סגנוני שמע

    ניתוח אקוסטי ומחקרי של מגוון רחב של קולות מדובבים בהיקף של אלפי שעות.

איפה זה נופל

החומרים מגיעים כולם ממשחקי מבוגרים ומכילים תוכן בוטה מאוד שלא מתאים למוצרים כלליים. ישנה הטיה כבדה לקולות נשיים בגלל אופי המקורות. בנוסף, כל התמלילים שסומנו כתוצרי מודל לא עברו בדיקה אנושית, כך שחלקם כולל שגיאות זיהוי שיכולות לפגוע באימון אם לא מנקים אותם.

אותה משפחה

Japanese-Eroge-Voice יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הרשמי בעמוד הוא MIT, שעל הנייר מתיר שימוש מסחרי מלא. בפועל, החומר נלקח ממשחקים מוגנים בזכויות יוצרים והיוצרים עצמם מציינים שהשימוש הוא על אחריותכם בלבד. לחברה שמפתחת מוצר מסחרי מומלץ לשקול היטב את הסיכון המשפטי מול בעלי הזכויות של המשחקים.

האם יש במאגר תמיכה בשפות נוספות חוץ מיפנית?

לא, המאגר כולו מורכב מקטעי דיבור ביפנית בלבד. הטקסטים והתמלילים הם ביפנית שנשלפה מתסריטי המשחקים או זוהתה על ידי מודל. מי שמחפש נתונים רב-לשוניים או עברית לא ימצא כאן מענה.

איך אספו את המידע והאם הטקסט מדויק?

האודיו הופק ממשחקי מבוגרים יפניים ועבר ערבוב אקראי. התמלול מגיע משני מקורות שונים לפי עמודת המקור, חלקו נלקח ישירות מהטקסט המקורי של המשחק וחלקו הופק באמצעות המודל anime-whisper. הקטעים שתומללו אוטומטית לא עברו אימות ידני, ולכן צריך לקחת בחשבון שגיאות זיהוי.

מה ההבדל בין גרסה זו לגרסה הראשונה של הפרויקט?

גרסה זו מציעה מעל 2,600 שעות שמע בהשוואה לגרסה הקודמת. אין כל חפיפה בין הקטעים, וכל מיליון ההקלטות כאן חדשות לחלוטין. אם כבר אימנתם מודל על הגרסה המקורית, מדובר בהרחבה נקייה בלי כפילויות.

איך טוענים

הנתונים מחולקים ל־521 קובצי parquet שונים ואינם דורשים אישור גישה מיוחד כדי להתחיל להוריד אותם. בגלל נפח של אלפי שעות מומלץ להזרים את המידע ישירות או לסנן מראש לפי שדה מקור התמלול, כדי לדעת אם עובדים עם תסריט מקורי או פלט של זיהוי דיבור אוטומטי.

from datasets import load_dataset

ds = load_dataset("NandemoGHS/Japanese-Eroge-Voice-V2")

הרישיון

המאגר מפורסם תחת רישיון MIT שמאפשר שימוש חופשי כולל שימוש מסחרי, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. עם זאת, היוצרים מדגישים שהתוכן נאסף ממשחקים מסחריים מוגנים ומיועד למחקר, ולכן השימוש בו במוצר מסחרי נעשה על אחריות המפתח בלבד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗