GPT
S

starrail-voice

קוד פתוח

simon3000רישיון לא דווח2024-04-26

המאגר מרכז קולות מוקלטים של דמויות מתוך המשחק Honkai: Star Rail בארבע שפות שונות. הוא מתאים למי שחוקר זיהוי דיבור או מאמן מודלים להפקת קול ומחפש דיאלוגים מגוונים עם תיוג שפתי.

  • 2,189הורדות בחודש
  • 62לייקים

מה זה

הנתונים נשלפו ישירות מחבילת המשחק הרשמית של HoYoverse באמצעות פריקה טכנית של הקבצים. המאגר מציע 403,437 קטעי אודיו בפורמט wav, הכוללים מגוון רחב של דיאלוגים מהעלילה, קריאות קרב וברכות של הדמויות השונות. הרשומות מגיעות בארבע שפות עיקריות בלבד: סינית, אנגלית, יפנית וקוריאנית, ומיועדות בעיקר למשימות של תמלול, סיווג קולי או סינתזת דיבור.

התיוג מבוסס על המידע המקורי של המשחק, וכולל את שפת ההקלטה, שם הדובר והתמלול המילולי של המשפט. לצד אלה, הכרטיס מציג בעיות כיסוי מובנות בנתונים הגולמיים. כ־15% מההקלטות, שהן 60,164 קטעים, מגיעות ללא שיוך לדובר, וב־61,375 קטעים אין תמלול בכלל. בנוסף, עבור 57,869 קבצים חסר שם הקובץ המקורי מתוך המשחק.

מתאים ל

  • אימון מודלי דיבור

    פיתוח מודלים להפקת דיבור וזיהוי קולי באנגלית, יפנית, סינית וקוריאנית על בסיס קולות מגוונים.

  • סיווג שפות ודוברים

    זיהוי אוטומטי של שפת הדיבור או זיהוי הדובר מתוך קטעי קול מרובי משתתפים.

  • מחקר אקדמי בקול

    בדיקת ביצועים של מודלי שמע על הקלטות סטודיו של משחקי וידאו לעומת דיבור טבעי.

איפה זה נופל

הנתונים מגיעים עם פערים גדולים שדורשים ניקוי יסודי לפני כל אימון. התמלולים כוללים סימוני מערכת ומשתנים של המשחק שלא עברו עיבוד, כמו תגיות של שמות שחקנים בתוך הטקסט, ומעבר לכך כחמש עשרה אחוזים מהשורות חסרות תמלול או שם דובר לחלוטין. הדוברים והדיאלוגים מותאמים לעולם הבדיוני ולמשחק בלבד, כך שהם לא מייצגים שפה טבעית או יומיומית. בנוסף, אין במאגר עברית בכלל, והוא מוגבל אך ורק לארבע השפות הנתמכות במשחק המקורי.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא, הנתונים הם קניין רוחני שמוגן בזכויות יוצרים של חברת המשחקים COGNOSPHERE. הכרטיס לא מגדיר שום רישיון קוד פתוח או היתר מסחרי. שימוש כזה במוצר סופי מהווה סיכון משפטי ברור.

האם המאגר כולל הקלטות בעברית?

המאגר אינו מכיל עברית כלל, אלא רק את השפות שנתמכות בדיבוב המשחק. כלל קטעי האודיו מוגבלים לסינית, אנגלית, יפנית וקוריאנית בלבד. אם המטרה היא פיתוח עבור השוק הישראלי, הנתונים האלה לא יעזרו.

איך נאספו קובצי האודיו האלה?

הנתונים נשלפו ישירות מחבילת ההתקנה של המשחק Honkai: Star Rail דרך תהליך פריקה טכני. המפרסם השתמש בסקריפטים וכלים חיצוניים כדי לחלץ את קובצי ה־wav יחד עם הטבלאות המקוריות. המידע לא הוקלט באופן עצמאי אלא הועתק מקוד המקור של המשחק.

עד כמה התמלול במאגר נקי ומוכן לשימוש?

התמלול דורש סינון מקדים כי כ־15% מההקלטות מגיעות ללא טקסט כלל. בנוסף, הטקסט הקיים כולל סימוני קוד ומשתנים מתוך המשחק כמו תגיות שמיועדות לשם השחקן. תצטרכו לנקות את התוכן הזה ידנית לפני שתזינו אותו למודל.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה הרגילה של Hugging Face בלי צורך באישור גישה ידני או מילוי טפסים. כלל הנתונים מחולקים על פני 48 קובצי parquet ממוספרים, כחלק מ־50 קבצים שקיימים במאגר הכולל. בעבודה מעשית חשוב לשים לב לשדות הדובר, התמלול ושם הקובץ במשחק, ולסנן אותם מראש בקוד. כדאי לקחת בחשבון שמדובר במאות אלפי קטעי קול, ולכן טעינה מקומית מלאה דורשת נפח אחסון פנוי וזמן פריקה משמעותי.

from datasets import load_dataset

ds = load_dataset("simon3000/starrail-voice")

הרישיון

הרישיון של המאגר לא דווח רשמית, אך זכויות היוצרים מצוינות כשייכות באופן מלא לחברת COGNOSPHERE. המשמעות היא שאין הרשאה חוקית לשימוש מסחרי מכל סוג שהוא, ולא הוגדרו תנאי שימוש חופשיים כמו ייחוס או שיתוף זהה. שימוש בחומרים כאלה לפיתוח מוצרים או לאימון מודלים מסחריים חושף אתכם לתביעות על הפרת קניין רוחני.

הרישיון המלא ב־Hugging Face ↗