GPT
R

zomehwh/rvc-models

רץ בדפדפן

zomehwhmit2023-04-21

  • gradio

המרת קול באמצעות מודלי RVC ישירות מהדפדפן, מקובץ שמע קיים או מטקסט מוקלד. הכלי מתאים למי שרוצה לבדוק עיבודי קול בלי להתקין חבילות פייתון כבדות במחשב.

  • הורדות בחודש
  • 125לייקים

מה זה

הממשק מציע שתי דרכים לקבל שמע. אפשר להעלות קובץ קול קיים, או לסמן מצב דיבור ולהקליד טקסט שמומר לדיבור בעזרת edge-tts, כולל בחירת קול כמו en-US-AnaNeural-Female. מהצד השני מקבלים קובץ שמע מעובד עם הודעות מערכת על התהליך.

מתחת למכסה רץ צינור עיבוד של Retrieval-based Voice Conversion שמשתמש ב־fairseq ובארכיטקטורות SynthesizerTrnMs256NSFsid. אפשר לשנות את גובה הצליל עם שדה Transpose, לבחור שיטת חילוץ תדר בסיסי (f0method), ולכוונן את יחס האינדקס בסליידר כדי לשלוט במידת הדמיון לקול המטרה.

מתאים ל

  • המרת שירה או דיבור קצר

    מעלים קטע שמע של עד עשרים שניות ומשנים את גוון הקול לפי המודל הנבחר.

  • הקראת טקסט בקול מותאם

    מקלידים עד מאה מילים, מפיקים דיבור דרך edge-tts וממירים אותו לקול היעד בלחיצה אחת.

  • בדיקת פרמטרים של RVC

    משחקים עם יחס האינדקס ושינוי גובה הצליל כדי לראות איך הם משפיעים על התוצאה.

איפה זה נופל

יש פה מגבלות קשיחות בקוד. קובץ השמע מוגבל לפחות מעשרים שניות, ובמצב טקסט מותר להזין עד מאה מילים בלבד. בנוסף, המערכת רצה על מעבד רגיל בלבד, מה שהופך המרות ארוכות לאיטיות מאוד בהשוואה להרצה מקומית על כרטיס מסך חזק.

שאלות
נפוצות

האם השימוש בממשק עולה כסף?

הגישה דרך הדפדפן חופשית לגמרי ואינה דורשת תשלום. הממשק נבנה על גבי תשתית ציבורית וכל הכלים בו זמינים מיד לשימוש. אין כאן מדרגות מחיר או צורך בהזנת פרטי אשראי.

כמה זמן לוקח לייצר קובץ שמע?

העיבוד לא נעשה באופן מיידי בגלל שהשרת משתמש במעבד בסיסי בלבד. המרה של קטע קצר יכולה לקחת חצי דקה עד מספר דקות, תלוי בעומס על המערכת ובאורך הקטע שהזנתם. אם השרת עמוס, זמני ההמתנה יתארכו.

האם אפשר להעלות הקלטות ארוכות?

לא, הממשק חוסם במפורש קבצים שאורכם עולה על עשרים שניות. אם תנסו להעלות קובץ ארוך יותר, המערכת תדחה אותו או תציג שגיאה. להמרות של שירים מלאים או פודקאסטים תצטרכו לחתוך את הקובץ מראש.

במה הממשק הזה שונה מהרצת RVC מלאה במחשב?

כאן מקבלים סביבה מוגבלת עם מגבלות זמן וטקסט שנועדה לבדיקות מהירות בלבד. בהרצה מקומית על מחשב שלכם אין הגבלת זמן, אפשר לאמן מודלים חדשים ועיבוד על כרטיס מסך מתבצע במהירות גבוהה בהרבה.

איך משתמשים

בוחרים לשונית של מודל, מעלים קובץ קול או כותבים טקסט במצב tts, מכוונים את הגדרות גובה הצליל ולוחצים על כפתור Generate. העיבוד רץ על חומרת מעבד בסיסית (cpu-basic) ללא כרטיס מסך ייעודי. זה אומר שעיבוד קול, במיוחד סביב הרף העליון של עשרים שניות, ידרוש סבלנות ולא יסתיים ברגע.

הרישיון

הפרויקט מפורסם תחת רישיון MIT שמאפשר שימוש חופשי, שינוי והפצה של הקוד. לגבי קובצי הקול שאתם מעלים או הטקסט שאתם מקלידים, הם נשלחים לשרת שבו רץ היישום כדי לבצע את ההמרה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗