GPT
V

VITS-Umamusume-voice-synthesizer

רץ בדפדפן

Plachtaרישיון לא דווח2022-12-17

  • gradio

היישום ממיר טקסט לקולות של דמויות אנימה ביפנית, סינית ואנגלית. הוא מיועד למי שמחפש יצירת דיבוב ספציפי של דמויות כמו ממשחקי Umamusume או גנשין אימפקט ישירות מהדפדפן.

  • הורדות בחודש
  • 610לייקים

מה זה

אתם כותבים טקסט בתיבה, בוחרים דמות מתוך רשימת הדוברים וקובעים את השפה. הקוד מריץ מודלי VITS עם תמיכה בהרצה דרך ONNX, ומאפשר גם שליטה במהירות הדיבור דרך סליידר ופתיחת אפשרות להזנת פונמות ידנית.

בנוסף להמרת טקסט לדיבור, הקוד כולל הכנה להמרת קול לקול בין הדמויות. הדוגמאות המוכנות מציגות משפטים ביפנית, סינית פשוטה ואנגלית עבור דמויות כמו Grass Wonder ו־Silence Suzuka מ־Umamusume, או Paimon מ־Genshin Impact, כולל שימוש בתגיות שפה מפורשות בטקסט.

מתאים ל

  • דיבוב סרטוני אנימציה

    יצירת קטעי שמע באנגלית, יפנית או סינית עבור דמויות מוכרות לפרויקטים אישיים.

  • הפקת שמע עם פונמות

    שליטה בהגייה מדויקת של מילים מורכבות דרך הזנת סמלים פונטיים ישירות למודל.

  • בדיקת איכות קול VITS

    בחינת יכולות מודל VITS בהפקת דיבור רב לשוני מבוסס תווים וקולות משחקים.

איפה זה נופל

אין כאן תמיכה בעברית כלל, אלא רק ביפנית, סינית ואנגלית. המודל מתבסס על שמות דמויות ספציפיים שהוגדרו מראש, כך שאי אפשר לאמן אותו על קולות חדשים דרך הממשק, והרצה על מעבד רגיל מגבילה מאוד את אורך הטקסט שתרצו לרנדר ברצף בלי להמתין דקות ארוכות.

שאלות
נפוצות

האם הכלי תומך ביצירת דיבור בעברית?

לא, אין שום תמיכה בעברית בקוד או במודלים שנטענים. המערכת מוגבלת לשלוש שפות בלבד: אנגלית, יפנית וסינית. הזנת טקסט בעברית פשוט לא תעבוד או תייצר שגיאה.

כמה זמן לוקח לייצר קטע קול?

היישום רץ על תשתית מעבד בסיסית ללא כרטיס גרפי. יצירת משפטים קצרים תארך כמה שניות, אבל פסקאות ארוכות יותר ידרשו המתנה ניכרת. המהירות מושפעת ישירות מעומס המעבד ומאורך הטקסט שהזנתם.

האם אפשר להשתמש בקבצי השמע באופן מסחרי?

לא כדאי להסתמך על זה כלל. מעבר לכך שלא דווח רישיון לפרויקט, הקולות מייצגים דמויות מוגנות בזכויות יוצרים כמו פיימון מגנשין אימפקט או דמויות מאוממוסומה. שימוש מסחרי בקולות אלה חושף אתכם להפרת זכויות של בעלי המותגים.

האם הממשק דורש התחברות כדי להתחיל לעבוד?

אין צורך בחשבון או בהתחברות כדי להשתמש בממשק. אתם נכנסים ישירות בדפדפן, בוחרים דמות מתוך הרשימה ומקלידים את הטקסט. הגישה פתוחה מיד לכל מי שמגיע לעמוד.

איך משתמשים

בוחרים בלשונית ה־TTS את המודל, מזינים את הטקסט, בוחרים דמות ושפה ולוחצים על כפתור ההפקה. המערכת רצה על מעבד בסיסי בלבד ללא האצת כרטיס מסך, מה שאומר שזמן העיבוד של קובץ השמע יהיה ארוך יותר ולא תקבלו תוצאה מיידית ברגע הלחיצה.

הרישיון

הרישיון של היישום לא דווח בקוד או בהגדרות. במצב כזה אין אישור שימוש מסחרי מוגדר, וקשה לדעת מה המגבלות החוקיות לגבי קולות הדמויות שנוצרו או זכויות היוצרים על הקבצים.

הרישיון המלא ב־Hugging Face ↗