GPT
G

genshin-voice-v3.3-mandarin

קוד פתוח

hanamizuki-aiרישיון לא דווח2022-12-30

המאגר כולל קולות ותמלילים של דמויות ממשחק המחשב גנשין אימפקט במנדרינית. הוא מיועד למי שמפתח מודלים של זיהוי דיבור או הקראת טקסט וצריך דיבוב מקצועי עם תיוג שמות הדוברים.

  • 1,892הורדות בחודש
  • 41לייקים

מה זה

הנתונים חולצו ישירות מקובצי המשחק Genshin Impact של חברת Hoyoverse. המקור הראשוני לעבודה הזו הוא מאגר שיצר משתמש בשם w4123, וכאן הוא ארוז מחדש עבור משימות דיבור. כל רשומה כוללת קטעי אודיו יחד עם תיוגים רשמיים שהגיעו מתוך המשחק עצמו, כולל התמליל המדויק ושם הדמות שמדברת בכל קטע.

הדוברים הם עובדי Hoyoverse ומדבבים מקצועיים מאולפני EchoSky Studio, כך שרמת ההקלטה היא של הפקת משחק ולא של דיבור יומיומי ספונטני. המאגר ממוקד כולו בשפה המנדרינית ומכיל גרסת תוכן שנשענת על עדכון 3.3 של המשחק מדצמבר 2022. אין בכרטיס פירוט לגבי סינון רעשים, חיתוך שתיקות או הסרת מוזיקת רקע, ולכן הנתונים מייצגים את מה שחולץ מהקבצים המקוריים כמו שהם.

מתאים ל

  • אימון מודלי הקראה

    בניית מודלים של הקראת טקסט במנדרינית עם מגוון קולות שונים של דמויות.

  • זיהוי דיבור במשחקים

    בדיקת ביצועים של מודלי תמלול על שמות בדיוניים ואינטונציות משחקיות.

  • זיהוי דוברים

    אימון מערכות לסיווג והפרדה בין קולות לפי שמות הדמויות המתויגות.

איפה זה נופל

הדיבור כאן הוא משחקי ומתוסרט בלבד, מה שאומר שהוא כולל שמות בדיוניים, אינטונציות דרמטיות וזמני הגייה שלא משקפים שיחה טבעית ברחוב. המאגר מוגבל למנדרינית ואינו כולל שום שפה אחרת, כולל עברית. בנוסף, המידע מייצג נקודת זמן אחת מסוף שנת 2022, ללא דמויות או דיאלוגים שנוספו בעדכונים מאוחרים יותר.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

לא. זכויות היוצרים שמורות לחברת COGNOSPHERE ולא ניתן שום רישיון פתוח. שימוש כזה מהווה הפרה של זכויות היוצרים של המשחק.

האם המאגר כולל עברית?

לא, אין בו שום תוכן בעברית. כל הדיאלוגים והתמלילים הם במנדרינית בלבד.

איך הנתונים נאספו?

הקבצים חולצו מתוך קובצי ההתקנה של המשחק Genshin Impact על ידי משתמש בשם w4123. הם כוללים את הדיבוב המקורי של עובדי חברת המשחקים ושחקני אולפן EchoSky Studio.

האם יש חלוקה מוכנה לטסט וטריין?

לא. כל הנתונים מגיעים בקובצי train ברצף, ותצטרכו לבצע פיצול עצמאי לפני האימון.

איך טוענים

המאגר מחולק ל־74 קובצי Parquet שונים תחת ספריית המידע, ללא חלוקה מובנית לסט בדיקה או אימון נפרד. אפשר לטעון אותו ישירות עם ספריית datasets של Hugging Face בלי צורך בבקשת גישה מיוחדת או אישור ידני. כדאי לשים לב לשדות של שם הדמות והתמליל כדי לסנן דוברים ספציפיים לפני תחילת העבודה.

from datasets import load_dataset

ds = load_dataset("hanamizuki-ai/genshin-voice-v3.3-mandarin")

הרישיון

לא מוגדר רישיון שימוש פתוח. הכרטיס מציין זכויות יוצרים מלאות של חברת COGNOSPHERE. המשמעות היא שאין הרשאה להשתמש בחומרים למטרות מסחריות, וכל שימוש במודל שמאומן על הקבצים האלה חושף אתכם להפרת זכויות יוצרים מול בעלי המשחק.

הרישיון המלא ב־Hugging Face ↗