GPT
X

xVASynth-TTS

רץ בדפדפן

Pendrokargpl-3.02024-02-04

  • docker
  • tts
  • t2s
  • sts
  • s2s

הופך טקסט לקול עם דגש על רגש ומשחקי תפקידים, ישירות מהמעבד. מתאים למי שרוצה לבדוק דיבוב מותאם בלי להסתבך עם התקנות כבדות.

  • הורדות בחודש
  • 74לייקים

מה זה

מזינים טקסט ומקבלים קובץ שמע שמנסה להישמע אנושי ולא מונוטוני. במקום עוד דיבוב שטוח, המטרה כאן היא לתפוס ניואנסים, שינויי גובה צליל ואינטונציה רגשית, בדגש על סגנונות ספציפיים שמוכרים ממשחקים כמו סקיירים לצד שפות וניסויים קוליים שונים.

מתחת למכסה רצה שורה שלמה של מודלים מוכרים מהתחום. הבסיס נשען על ארכיטקטורות כמו VITS, FastPitch ו־YourTTS ליצירת דיבור מהירה ומרובת דוברים, כשאליהן משודכים רכיבים כמו TorchMoji לחיזוי רגש ורשתות זרימה להתאמת גובה הצליל. הקוד מושך משקלים שונים מראש, כולל מודלים ייעודיים לגיימינג ולשפות ניסיוניות כמו לוג'באן.

הממשק עוטף את הפרויקט המקורי של DanRuta ומנגיש אותו בדפדפן דרך קונטיינר, כך שאפשר לשחק עם הטקסט והפרמטרים ישירות בלי לגעת בקוד מקור.

מתאים ל

  • דיבוב מודים למשחקים

    יצירת קטעי קול מהירים לדמויות במשחקי תפקידים כמו סקיירים ישירות מהדפדפן.

  • בדיקת אינטונציה ורגש

    בחינה של דיבור ממוחשב שמנסה לחקות רגש ולא רק להקריא טקסט יבש.

  • התנסות במודלי קול נדירים

    הרצת טקסטים בשפות ניסיוניות או הגדרות קוליות שקשה למצוא במערכות רגילות.

איפה זה נופל

זה לא תחליף לשירותי ענן מסחריים מלוטשים, ואין כאן תמיכה בעברית. המודלים שמוטמעים מיועדים לשפות ולסגנונות מסוימים, ובמיוחד לאנגלית או ניסויי שפה ייעודיים. התיעוד מציין במפורש שהאימון נשען על מאגרי מידע לא מורשים או לא ידועים, כך שהאיכות והדיוק משתנים מקול לקול. אל תצפו לאמינות של קריינות מקצועית אם הטקסט ארוך או מורכב מדי.

שאלות
נפוצות

האם השימוש עולה כסף?

האפליקציה פתוחה ורצה בחינם בדפדפן. אין צורך לשלם על זמן ריצה או לרכוש מנוי כדי לבדוק אותה.

כמה זמן לוקח להפיק שמע?

מאחר שהעיבוד נעשה על מעבד ולא על כרטיס גרפי ייעודי, הפקת קטע קצר אורכת כמה שניות. קטעים ארוכים יותר ידרשו המתנה ממושכת יותר.

מה קורה לטקסט שאני מזין?

הטקסט נשלח ישירות לשרת שמריץ את הקונטיינר כדי לייצר את הקובץ. אין כאן שמירה מתועדת של היסטוריה, אבל המידע כן עובר דרך שרתי הרשת.

אפשר להריץ את זה על המחשב שלי?

כן, הפרויקט מבוסס על קוד פתוח בגיטהאב שנועד במקור לפעול על המחשב האישי. אפשר להוריד את המאגר המקורי של DanRuta ולהריץ אותו מקומית.

איך משתמשים

נכנסים לעמוד וכותבים את הטקסט שרוצים להקריא. בוחרים את המודל או הקול המתאים מתוך הרשימה הטעונה, ולוחצים על כפתור ההפקה. אין צורך בהרשמה מיוחדת או בהזנת מפתח גישה.

הקוד רץ על גבי מעבד משודרג, מה שאומר שהעיבוד לא תלוי בכרטיס מסך חיצוני אבל כן לוקח מעט זמן חישוב, במיוחד כשהמודלים הראשוניים צריכים להיטען מהזיכרון. זמן ההמתנה לקובץ תלוי בעיקר באורך הטקסט שבחרתם.

הרישיון

הקוד עצמו מפורסם תחת רישיון gpl-3.0, מה שמחייב קוד פתוח אם אתם משתמשים בו הלאה. עם זאת, היוצר מציין שמאגרי המידע שעליהם אומנו המודלים מוגדרים כלא ידועים או ללא הרשאה מסחרית, ולכן אסור להשתמש בתוצרי השמע לצרכים מסחריים.

הרישיון המלא ב־Hugging Face ↗