GPT
S

sovits-teio

רץ בדפדפן

zomehwhmit2023-04-02

  • gradio

המרת קול ודיבור לקול של הדמות Teio באמצעות מודל So-VITS-SVC. מתאים למי שרוצה לבדוק עיבוד קול קצר בלי להגדיר שום דבר במחשב.

  • הורדות בחודש
  • 97לייקים

מה זה

מעלים קובץ שמע של דיבור או שירה, והקוד מריץ עליו מודל מסוג So-VITS-SVC כדי להלביש עליו את גוון הקול של הדמות. במקום קובץ קיים אפשר גם להפעיל מצב טקסט, לבחור קול בסיס מתוך רשימה שמגיעה מ־edge-tts, להקליד משפט ולקבל קודם כל הקראה ממוחשבת שעוברת מיד המרה לקול היעד.

בצד המשתמש מקבלים נגן עם קובץ השמע המעובד ותיבת הודעות עם סטטוס הריצה. יש בממשק שליטה על שינוי גובה הצליל דרך vc_transform, ואפשרות להפעלת זיהוי אוטומטי של גובה הצליל עם auto_f0 למי שרוצה לכוון את התוצאה בדיבור או בשירה.

מתאים ל

  • המרת שירה ודיבור קצר

    החלפת גוון הקול בהקלטה של עד עשרים שניות לקול של Teio בלחיצת כפתור אחת.

  • הקראת טקסט מותאמת

    הקלדת עד מאה מילים, המרתן לדיבור דרך edge-tts ותרגומן המיידי לקול המודל.

  • בדיקת פרמטרי גובה צליל

    משחק עם vc_transform ו־auto_f0 כדי לבחון איך שינוי פיץ' משפיע על מודל svc.

איפה זה נופל

יש פה מגבלות חדות שנאכפות בקוד. הקלטת שמע מוגבלת לפחות מעשרים שניות, ובמצב טקסט יש תקרה של מאה מילים בלבד. אם תנסו לעבד קטעים ארוכים או פודקאסט, זה פשוט לא יעבוד.

בנוסף, הריצה על מעבד פשוט גורמת לזמני עיבוד ארוכים יחסית לכל קטע קצר. איכות הפלט תלויה לחלוטין ברמת ההקלטה שהזנתם, ורעשי רקע ייכנסו ישר לתוך התוצאה המומרת.

שאלות
נפוצות

האם השימוש בהדגמה עולה כסף?

לא, הגישה פתוחה בדפדפן ללא תשלום. אין צורך להזין אמצעי תשלום כדי להעלות קובץ או להמיר טקסט. פשוט נכנסים ומריצים.

כמה זמן לוקח לכל המרה להסתיים?

המודל פועל על חומרת מעבד בלבד ללא מאיץ גרפי. בגלל המגבלה הזו, עיבוד של קטע שלם באורך עשרים שניות ייקח זמן רב יותר מאשר ריצה על שרת עם חומרה ייעודית. התוצאה לא מתקבלת באופן מיידי.

האם אפשר להעלות קובץ שמע בכל אורך?

לא, המערכת חוסמת קבצים ארוכים. הממשק מגביל את הקלט לעד עשרים שניות עבור קובץ שמע, ועד מאה מילים אם משתמשים במצב טקסט לדיבור. קטעים ארוכים מזה ייכשלו.

האם אפשר להריץ את זה באופן מקומי?

כן, הקוד מבוסס על ספריות סטנדרטיות כמו Gradio ו־librosa וזמין תחת רישיון MIT. אפשר להוריד את הקבצים ולהפעיל אותם על מחשב אישי, רצוי עם מאיץ גרפי כדי לקבל ביצועים סבירים.

איך משתמשים

בוחרים אם להעלות הקלטה או להקליד טקסט. בהעלאת קובץ מזינים שמע, קובעים אם לשנות את ערך הטרנספורמציה או להפעיל כיוון תדר אוטומטי, ולוחצים על כפתור Generate. אם עוברים למצב טקסט, מקלידים עד מאה מילים ובוחרים קול מקדים מהתפריט.

ההדגמה רצה על מעבד בסיסי רגיל ללא כרטיס גרפי ייעודי, תצורת cpu-basic. זה אומר שעיבוד של עשרים שניות שמע לא יחזור ברגע, וצריך להמתין בסבלנות עד שפעולות החישוב וההסקה של הרשת יסתיימו.

הרישיון

הפרויקט מפורסם תחת רישיון MIT. הרישיון הזה מתיר שימוש חופשי בקוד, כולל שינוי והפצה, אך אינו מפרט לגבי זכויות היוצרים על נתוני האימון המקוריים של קול הדמות או קבצי השמע שאתם מעלים לממשק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗