GPT
G

genshin-voice

קוד פתוח

simon3000רישיון לא דווח2024-04-25

מאגר של מאות אלפי קבצי שמע של דמויות ממשחק המחשב גנשין אימפקט בארבע שפות שונות. הוא מתאים למי שמחפש קולות מגוונים בדיבוב מקצועי לאימון מודלים של זיהוי ויצירת דיבור.

  • 23,203הורדות בחודש
  • 265לייקים

מה זה

המאגר מכיל מעל 650 אלף קבצי שמע בפורמט וואב, שחולצו ישירות מקבצי ההתקנה של המשחק גנשין אימפקט שפותח בידי חברת מיהויו. ההקלטות מכסות דיאלוגים מהעלילה, משפטי קרב וברכות, בארבע שפות: סינית, אנגלית, יפנית וקוריאנית. כל רשומה כוללת את שם קובץ המקור במשחק, מזהה ייחודי, שפת הדיבוב, ולרוב גם את שם הדמות והתמליל המקביל.

לפי התיעוד, הנתונים מתבססים על הגדרות רשמיות מתוך קבצי המשחק עצמו. למרות שמדובר במידע פנימי, חלק מהרשומות חלקיות: כחמישים ושתיים אלף הקלטות מגיעות ללא תמלול טקסטואלי, וכשבעת אלפים הקלטות נותרו ללא זיהוי שם הדובר. יש גם אפשרות להוריד ארכיונים מקובצים לפי דוברים ושפות דרך קישורים נפרדים שמצוינים במאגר.

מתאים ל

  • אימון מודלי הקראה

    יצירת קולות סינתטיים של דמויות בדיבוב מקצועי בסינית, אנגלית, יפנית וקוריאנית למטרות מחקר אישי.

  • זיהוי דוברים

    אימון וסיווג מודלים לפי שמות הדמויות, לאחר סינון הרשומות שבהן שדה הדובר קיים וברור.

  • זיהוי דיבור אוטומטי

    בדיקת מודלי שמע לטקסט על פני ארבע שפות, תוך שימוש ברשומות הכוללות תמלול מלא וללא תגיות.

איפה זה נופל

התיוגים במאגר אינם מושלמים ודורשים ניקוי יסודי. שמונה אחוזים מההקלטות מגיעות ללא תמליל כלל, ואחוז אחד חסר שם דובר. בעיה משמעותית נוספת היא שתמלילי הדיאלוג מכילים תגיות עיצוב גרפיות של מנוע המשחק, סימוני צבע ומשתנים של שמות שחקנים בתוך הטקסט. הנתונים מתאימים אך ורק לארבע שפות המקור של המשחק, כך שאין כאן שום מידע בעברית, וסגנון הדיבור הוא משחקי ומאופיין במשחק תפקידים ולא בדיבור יומיומי טבעי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

ממש לא. הקבצים נשלפו ישירות מתוך המשחק ושייכים בלעדית לחברת קוגנוספיר. אין למאגר רישיון חופשי, ושימוש מסחרי בו חושף אתכם להפרת זכויות יוצרים בוטה.

האם יש במאגר נתונים בעברית?

לא. המאגר מכיל אך ורק את השפות שבהן המשחק דובב במקור, והן סינית, אנגלית, יפנית וקוריאנית. אין בו שום ייצוג לעברית, לא באודיו ולא בתמלול.

איך הנתונים נאספו ונבנו?

היוצר חילץ את קבצי השמע ישירות מחבילת ההתקנה של המשחק במחשב והמיר אותם לפורמט וואב. התמלילים ושמות הדמויות נמשכו מתוך קבצי ההגדרות והמטא דאטה של המשחק עצמו.

האם הטקסטים מוכנים לעבודה מיידית?

לא תמיד. חלק מהשורות מכילות תגיות קוד פנימיות של יוניטי, צבעים ומשתנים כמו ניקניים שלא הוחלפו. תצטרכו להריץ ניקוי טקסט בסיסי לפני שתוכלו להשתמש בהם לאימון.

איך טוענים

הנתונים מפוצלים לעשרות קבצי פרקט, לפחות שבעים וחמישה חלקים של אימון, ומכילים אלפי קבצים נלווים. אפשר לטעון אותו בעזרת ספריית הדאטהסטס הרגילה בפייתון, אך קחו בחשבון שמדובר בנפח שמע עצום שידרוש מקום פנוי רב בדיסק וזמן פריסה משמעותי. הגישה למאגר פתוחה ואינה דורשת אישור מיוחד. בעבודה השוטפת חשוב לסנן לפי שדות השפה והדובר, ולוודא מראש ששדה התמלול אינו ריק אם המטרה שלכם היא משימת דיבור לטקסט.

from datasets import load_dataset

ds = load_dataset("simon3000/genshin-voice")

הרישיון

המאגר אינו כולל רישיון קוד פתוח. זכויות היוצרים על כלל קבצי הקול והתמלילים שייכות לחברת קוגנוספיר ומיהויו, בעלות המשחק. המצב המשפטי הזה אומר שאסור להשתמש בחומרים לשום מטרה מסחרית, וכל מודל שתאמנו עליהם עלול להיות חשוף לתביעות של הפרת קניין רוחני. אם אתם בונים כלי למכירה, חפשו מקור אחר לחלוטין.

הרישיון המלא ב־Hugging Face ↗