GPT
V

VoiceClone-TTS

רץ בדפדפן

ginigenרישיון לא דווח2025-02-14

  • gradio

המרת טקסט לדיבור ושכפול קול מבוססי מודל Zonos עם שליטה ברגשות ובאיכות השמע. מיועד למי שרוצה לבדוק דיבוב קולי מותאם אישית ישירות בדפדפן.

  • הורדות בחודש
  • 314לייקים

מה זה

מזינים טקסט באורך של עד 500 תווים, בוחרים שפת יעד מתוך רשימת הקודים הנתמכים, ואם רוצים לשכפל קול ספציפי, מעלים קובץ שמע של הדובר. אפשר גם להעלות קובץ התחלתי כדי להמשיך קטע דיבור קיים. הפלט שמתקבל הוא קובץ שמע מוגמר להאזנה ולהורדה.

מאחורי הקלעים פועלים מודלי Zonos v0.1 של חברת Zyphra, בגרסת Transformer או בגרסת Hybrid, לצד מודל קידוד השמע descript dac 44khz ומודל לחילוץ מאפייני דובר. עיבוד הפונמות לשפות השונות מתבצע באמצעות ספריית eSpeak.

הממשק כולל שמונה מחווני רגשות בהם שמחה, עצב, פחד, הפתעה, כעס וניטרליות. בנוסף יש שליטה ידנית בפרמטרים אקוסטיים כמו מהירות הדיבור, איכות צליל בסולם של 1.0 עד 5.0, תדר מרבי עד 24000 הרץ, גיוון בגובה הקול, ואפשרות לסינון רעשים מקובץ הדובר.

מתאים ל

  • שכפול קול לקטעים קצרים

    העלאת דגימת קול כדי להקריא משפטים קצרים באותו גוון דיבור.

  • הפקת שמע עם הבעות רגש

    כוונון מחווני רגשות כמו שמחה או כעס לצורך יצירת דיבוב דרמטי למשחקים או סרטונים.

  • בדיקת איכות מודלי Zonos

    השוואה מעשית בין גרסת הטרנספורמר לגרסה ההיברידית של המודל על אותו הטקסט.

איפה זה נופל

המגבלה הראשונה היא שהאפליקציה מושהית לחלוטין כרגע ולא ניתנת להפעלה ישירה. בנוסף, מגבלת הטקסט קשיחה ועומדת על 500 תווים בלבד לכל ריצה, כך שהיא לא מתאימה להקראת מסמכים ארוכים. התמיכה בשפות תלויה במנוע eSpeak החיצוני, מה שאומר שאיכות ההגייה בשפות שאינן אנגלית עלולה להישמע רובוטית או מקוטעת.

שאלות
נפוצות

האם השימוש באפליקציה בחינם?

הגישה לממשק עצמו חופשית, אך כרגע האפליקציה במצב מושהה ולא רצה בענן. כדי להשתמש בה יש לשכפל אותה לחשבון אישי, מה שעשוי לדרוש משאבי מחשוב בתשלום אם בוחרים להריץ אותה על מעבד גרפי.

מה קורה לקובצי השמע שאני מעלה?

הקבצים מועברים ישירות לעיבוד בממשק Gradio לצורך חילוץ מאפייני הקול. מאחר שמדובר בהדגמה ציבורית ללא מדיניות פרטיות מוגדרת או רישיון מדווח, מוטב לא להעלות הקלטות פרטיות של אנשים ללא אישורם.

האם אפשר להריץ את הכלי במחשב מקומי?

כן, קוד המקור ב־Python זמין ומשתמש בספריות מוכרות כמו PyTorch ו־Zonos. עם זאת, תצטרכו מחשב עם מאיץ גרפי התומך ב־CUDA כדי שהפקת השמע תעבוד במהירות סבירה ולא תיכשל.

למה האפליקציה מציגה שגיאה ולא מייצרת קול?

האפליקציה מוגדרת במצב מושהה על ידי היוצר שלה והחומרה שהוקצתה לה היא מעבד בסיסי בלבד. במצב הנוכחי המודלים אינם טעונים בזיכרון ולכן לא ניתן להפיק שמע בדפדפן בלי להפעיל אותה מחדש בחשבון נפרד.

איך משתמשים

בוחרים מודל, כותבים טקסט, מגדירים מאפיינים ולוחצים על כפתור יצירת השמע. אין צורך בהרשמה או התחברות כדי לגשת לממשק. עם זאת, האפליקציה נמצאת כעת במצב מושהה והחומרה הרשומה לה היא מעבד בסיסי בלבד. כל עוד היא מושהית אי אפשר להריץ אותה בדפדפן, וכדי להפעיל אותה יש צורך לשכפל את הקוד ולהריץ אותו באופן עצמאי על חומרה מתאימה, רצוי עם מאיץ גרפי שכן הקוד תוכנן לעיבוד מהיר בטכנולוגיית CUDA.

הרישיון

הרישיון של היישום לא דווח כלל במאגר. ללא רישיון מוגדר וברור, השימוש בקוד, במודלים ובתוצרי השמע שנוצרים עלול להיות מוגבל משפטית, ולא מומלץ להסתמך עליהם לשימושים מסחריים או להעלות הקלטות קול רגישות.

הרישיון המלא ב־Hugging Face ↗