GPT
J

japanese-anime-speech-v2

קוד פתוח

joujiboigpl2024-06-26

  • japanese
  • anime
  • speech
  • 日本語
  • audio-text

המאגר כולל קטעי אודיו ותמלולים של יפנית מרומנים חזותיים. הוא פותר את הקושי של מודלי זיהוי דיבור רגילים עם אינטונציות, סלנג ודפוסי הגייה שמאפיינים אנימה.

  • 1,963הורדות בחודש
  • 149לייקים

מה זה

הנתונים מורכבים מ־292,637 צמדי אודיו וטקסט שנלקחו ישירות מרומנים חזותיים יפניים. המטרה של המפרסם היא לאפשר שיפור מודלים כמו Whisper בהתמודדות עם משלבי דיבור דרמטיים שלא קיימים בשיחות יומיום רגילות. רוב ההקלטות מגרסה 1 לא נמצאות כאן, כך שמדובר בתוכן חדש לגמרי ולא רק בעדכון.

התוכן מחולק לשני פיצולים נפרדים על בסיס כללים אוטומטיים, עם 397.54 שעות של תוכן נקי המהוות 86.8 אחוז, ועוד 52.36 שעות של תוכן למבוגרים בלבד. הסינון כלל הסרת קבצים ללא דיבור, ניקוי רצועות באיכות ירודה ונרמול של תווים חוזרים בטקסט, כאשר אורך קטע ממוצע בחלק הנקי עומד על 5.3 שניות.

מתאים ל

  • אימון תמלול לאנימה

    התאמת מודלים כמו Whisper לסגנון הדיבור, המשלבים והאינטונציות הייחודיים של אנימה.

  • הערכת ביצועים ביפנית

    בדיקת הדיוק של מנועי תמלול קיימים על פסקולים של משחקים יפניים עם מוזיקה או אפקטים.

  • מחקר קולות שחקנים

    אימון מערכות שמנתחות דיבור תיאטרלי, דרמטי ומובחן של מדבבות מקצועיות.

איפה זה נופל

המקור הוא רומנים חזותיים, ולכן קיים עודף מובהק של קולות נשיים ואוצר מילים שסובב סביב רומנטיקה, יחסים ופנטזיה. השחקנים מקליטים באולפן מקצועי, בדיבור איטי וברור בהרבה משיחה אמיתית ברחוב. הטקסטים לא עברו ניקוי עמוק מעבר לצמצום תווים חוזרים, וההפרדה של תכנים בוטים נעשתה בכללים אוטומטיים בלבד, כך שאי אפשר להסתמך עליה במאה אחוז.

אותה משפחה

japanese-anime-speech יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

המפרסם כתב בפירוש שכל אחד יכול להשתמש בחומרים למטרות מסחריות, אך הרישיון הרשום בעמוד הוא gpl. בנוסף, ההקלטות מגיעות ממשחקים מסחריים. מומלץ להתייעץ משפטית לפני שילוב במודל סגור.

האם הדאטהסט מתאים לשיפור דיבור יפני יומיומי?

לא ממש. הדיבור מבוצע על ידי שחקנים מקצועיים, בקצב איטי ובדיקציה מוגזמת של משחקים ואנימה. הוא פחות מייצג שיחות רחוב טבעיות או פגישות עסקיות ביפן.

האם יש במאגר תוכן בשפות אחרות או בעברית?

אין שום שפה מלבד יפנית. כל קטעי הקול והתמלולים הם ביפנית בלבד ומיועדים ספציפית לשפה זו.

איך אפשר לוודא שלא נכנס תוכן למבוגרים לאימון?

היוצר פיצל את הנתונים לקובצי nsfw נפרדים, אבל מודה שהסינון התבסס על כללים ולא נבדק ידנית לחלוטין. אם המוצר שלכם רגיש לתוכן כזה, תצטרכו להריץ בדיקה וסינון נוספים משלכם.

איך טוענים

המאגר מחולק לקובצי parquet וכולל רשימת תמלולים מלאה בקובץ טקסט ייעודי. לא צריך לבקש אישור גישה מיוחד כדי להוריד את הקבצים או להשתמש בהם. רצועות הקול שמורות בפורמט mp3 בדחיסה של 128kbps, מה שמצמצם את נפח האחסון בהשוואה לגרסאות קודמות. בעבודה שוטפת צריך לשים לב לפיצול בין קובצי הדיבור הרגילים לבין קובצי ה־nsfw, כדי לא לערבב תוכן לא הולם באימון.

from datasets import load_dataset

ds = load_dataset("joujiboi/japanese-anime-speech-v2")

הרישיון

המפתח דיווח על רישיון gpl, אבל בטקסט עצמו ציין שהמאגר פתוח לשימוש מסחרי ולא מסחרי וביקש קרדיט במידת האפשר. יש כאן סתירה מול רישיון gpl הקלאסי שמחייב פתיחת קוד של נגזרות. אם אתם בונים מוצר קנייני מסחרי, קחו בחשבון את המעמד המשפטי של הרישיון המדווח ושל חומרי המקור שנלקחו ממשחקים מסחריים.

הרישיון המלא ב־Hugging Face ↗