GPT
V

vits-uma-genshin-honkai

רץ בדפדפן

zomehwhapache-2.02023-01-20

  • gradio

הכלי מייצר קבצי קול מטקסט בקולות של דמויות ממשחקים כמו גנשין אימפקט והונקאי. הוא מיועד למי שרוצה לשמוע משפטים קצרים ביפנית או סינית בקול של דמות ספציפית.

  • הורדות בחודש
  • 374לייקים

מה זה

מזינים טקסט בסינית, ביפנית, או שילוב של שתיהן בעזרת תיוג מיוחד של קטעי הטקסט, ובוחרים דובר מתוך רשימה ארוכה שכוללת מאות דמויות. בנוסף אפשר לכוונן שלושה מחוונים ששולטים על מהירות הדיבור, רמת הרגש ואורך הפונמות. בסיום התהליך מקבלים נגן שמע עם התוצאה, כפתור להורדת קובץ האודיו, ותיבות שמציגות הודעות פלט ומידע נוסף.

מאחורי הקלעים רץ מודל VITS שמשתמש במחלקה בשם SynthesizerTrn וברכיב text_to_sequence להמרת הטקסט לרצף צלילים. הממשק כולל לשונית ייעודית לצפייה בכל הדמויות הזמינות ואפשרות לחיפוש דמות לפי שם, כשרשימת הבחירה מכילה מעל 200 דוברים שונים.

מתאים ל

  • דיבוב משפטים לדמויות

    יצירת קטעי דיבור ביפנית או בסינית בקול של דמויות מוכרות ממשחקים.

  • בדיקת טקסט דו-לשוני

    הקראת משפטים שמשלבים סינית ויפנית יחד בעזרת תיוג הקטעים.

  • הורדת דגימות קול

    הפקת קבצי שמע קצרים מותאמים אישית ושמירה שלהם ישירות למחשב.

איפה זה נופל

הכלי מוגבל אך ורק לסינית וליפנית, כך שאין שום תמיכה בעברית או באנגלית. אם רוצים לשלב בין שתי השפות, חייבים לעטוף כל קטע ידנית בתגיות ייעודיות, אחרת הפלט ישתבש. בנוסף, הריצה על מעבד רגיל מגבילה את קצב העבודה, וטקסטים ארוכים ייכשלו בגלל מגבלת מאה המילים המובנית.

שאלות
נפוצות

האם השימוש עולה כסף?

לא, הממשק פתוח וחינמי לגמרי בדפדפן. אין צורך להירשם או להזין פרטי תשלום.

האם המערכת שומרת את הטקסט שמקלידים?

הטקסט נשלח לעיבוד בשרת שבו רץ הקוד לצורך הפקת האודיו. חוץ מזה לא מוגדר בקוד שום מנגנון לשמירת הנתונים שלכם.

אפשר להריץ את זה על המחשב האישי?

כן, הקוד כתוב ב־Python ומשתמש ב־PyTorch וב־Gradio, ברישיון קוד פתוח apache-2.0. אפשר להוריד את הקבצים ולהפעיל אותם מקומית עם החבילות המתאימות.

כמה זמן לוקח לייצר קובץ קול?

השרת מבוסס על מעבד רגיל ללא האצת חומרה גרפית, ולכן העיבוד לוקח מספר שניות לכל משפט. אם יש עומס של משתמשים, ההמתנה עלולה להתארך מעט.

איך משתמשים

פותחים את הדפדפן וניגשים ישר לממשק, בלי צורך בחשבון או בהתחברות. מדביקים את הטקסט, בוחרים שפה, מוצאים את הדמות הרצויה ולוחצים על Submit. הדף רץ על מעבד בסיסי, cpu-basic, בלי כרטיס גרפי ייעודי, ולכן הפקת האודיו תיקח מעט זמן ולא תהיה מיידית. אם מופעלת הגבלה בקוד, המערכת תעצור טקסטים של מעל 100 מילים.

הרישיון

הקוד מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי, שינוי והפצה. הטקסט שאתם מזינים מעובד ישירות באפליקציה, והאודיו שנוצר זמין להורדה מקומית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗