GPT
S

styletts2

רץ בדפדפן

styletts2רישיון לא דווח2023-11-21

  • gradio

הופך טקסט מוקלד לדיבור שנשמע טבעי כולל אפשרות לשכפול קול מקובץ. מיועד למי שרוצה לבדוק דיבוב באנגלית או לייצר פסקול קולי ישירות מהדפדפן.

  • הורדות בחודש
  • 734לייקים

מה זה

מזינים טקסט באנגלית ומקבלים קובץ שמע להאזנה ולהורדה. המערך כולל מספר מצבי עבודה, ביניהם בחירה מתוך רשימת קולות קבועה כמו m-us-2, מודל שמבוסס על מאגר LJSpeech, ומצב שכפול שבו מעלים הקלטת קול באורך של עד 300 שניות כדי שהקול המוקלט יקריא את הטקסט.

מאחורי הקלעים רצים המודלים StyleTTS2-LibriTTS ו־StyleTTS2-LJSpeech. השיטה משתמשת בתהליך דיפוזיה, והממשק נותן לשחק עם מספר צעדי הדיפוזיה בין 3 ל־20. המפתחים עצמם מציינים בהגדרות שצעדים רבים יותר אמורים לשפר איכות על חשבון מהירות, אך בפועל קשה להבחין בהבדל ולכן כדאי להישאר במספרים נמוכים.

במצב השכפול יש גם שליטה על מקדמי אלפא, בטא ומדד שנקרא Embedding Scale. המודל עובד טוב יותר על משפטים מלאים, וכשמזינים קטעים קצרים מדי עם ערכי הטמעה גבוהים, הממשק מתריע מראש שעלולים לקבל רעש סטטי במקום דיבור נקי.

מתאים ל

  • יצירת קריינות באנגלית

    הפקת דיבור בקולות מוכנים מראש מתוך טקסט כתוב, ישירות לקובץ להורדה.

  • שכפול קול מהקלטה

    העלאת קובץ קול קצר כדי להקריא טקסט חדש באותו גוון דיבור.

  • בדיקת איכות של StyleTTS 2

    השוואת ביצועים ומהירות של מודל הדיפוזיה מול פתרונות דיבור אחרים.

איפה זה נופל

המודלים אומנו על מאגרי LibriTTS ו־LJSpeech באנגלית, כך שאין כאן שום תמיכה בעברית. טקסט קצר מדי עלול לייצר רעש סטטי וצרימות, במיוחד בשכפול קול. בנוסף, קיימת הגבלת אורך של 50,000 תווים ברוב המצבים, ואפשרות הטקסט הארוך עם קוד גישה מנוטרלת בקוד הממשק.

שאלות
נפוצות

האם השימוש עולה כסף?

לא. האפליקציה פתוחה לשימוש חופשי בדפדפן על גבי החומרה המשותפת שהוקצתה לה.

האם אפשר להקריא טקסט בעברית?

לא. המודלים שרצים כאן אומנו על מאגרי שמע באנגלית בלבד, וטקסט בעברית לא יעבוד.

כמה זמן לוקח לייצר שמע?

ההרצה מתבצעת על מאיץ A10G ומשפטים רגילים מופקים תוך שניות בודדות. בחירה במספר צעדי דיפוזיה נמוך מקצרת את הזמן עוד יותר.

מה קורה עם קבצי הקול שאני מעלה לשכפול?

הקבצים נשלחים לשרת לצורך יצירת הדגימה והפעלת המודל. אל תעלו הקלטות רגישות או פרטיות שאינכם רוצים שיעברו ברשת.

איך משתמשים

בוחרים לשונית, מקלידים את הטקסט, מכוונים את הסליידרים ולוחצים על Synthesize. הכל רץ על גבי חומרת zero-a10g שמקצה כרטיס גרפי בעת הבקשה, כך שהעיבוד מהיר מאוד ואין צורך בהתקנה. אין דרישה להרשמה או לתשלום, והנגן מציג את גל הקול עם כפתור הורדה ישיר בסיום.

הרישיון

הרישיון בדף לא דווח, אך בקובץ התיעוד מופיע רישיון AGPLv3. המשמעות היא שאם אתם לוקחים את הקוד או משלבים אותו בפרויקט משלכם, תצטרכו לשחרר את הקוד שלכם תחת אותו רישיון קוד פתוח. שמע שאתם מעלים ומייצרים מעובד בשרת חיצוני.

הרישיון המלא ב־Hugging Face ↗