GPT
F

FreeVC

רץ בדפדפן

OlaWodmit2022-12-14

  • gradio

הכלי לוקח הקלטת קול ומלביש עליה גוון קול של אדם אחר מדגימה קצרה, בלי צורך בטקסט. הוא מיועד למי שרוצה לבדוק המרת קול מהירה ישירות מהדפדפן.

  • הורדות בחודש
  • 112לייקים

מה זה

אתם מעלים שני קבצי שמע. הראשון הוא קובץ המקור עם הדיבור שתרצו להמיר, והשני הוא קובץ הייחוס שממנו נלקח גוון הקול החדש. הממשק מאפשר לבחור בין שלוש גרסאות מודל: FreeVC הרגיל, FreeVC-s, וגרסה שתומכת בדגימה של 24kHz. הפלט הוא קובץ אודיו חדש שמשלב את תוכן הדיבור מהקובץ הראשון עם מאפייני הקול של הקובץ השני.

מאחורי הקלעים רץ המודל microsoft/wavlm-large לצד מקודד דוברים ייעודי וסינתיסייזר. המערכת מנסה לחלץ את תוכן הדיבור בלי תמלול, ולהעתיק רק את זהות הדובר. בדוגמאות המוכנות מראש מוצגים קבצי בדיקה סטנדרטיים בשמות p225 ו־p226 שמדגימים החלפה הדדית בין הדוברים.

מתאים ל

  • החלפת קול בדיבוב

    שינוי גוון הקול של שחקן אחד לקול של שחקן אחר לפי דגימה קצרה וללא תמלול.

  • בדיקת מודל FreeVC

    השוואה מהירה בין גרסת הבסיס, גרסת s וגרסת 24kHz על אותם קבצי מקור.

  • יצירת דמויות בפודקאסט

    המרת הקלטת דיבור קיימת לצליל של דובר אחר כדי לגוון קולות בהפקה.

איפה זה נופל

הבעיה המיידית היא שההדגמה נמצאת במצב שגיאה ולא עובדת כרגע בדפדפן. מעבר לכך, המפתח עצמו מציין בקוד שמשקולות WavLM ב־HuggingFace מעט שונות מאלו ששימשו לאימון המקורי, מה שעלול לפגוע באיכות התוצאה. המודל גם רגיש מאוד לשקט בקובץ הייחוס, ואם לא חותכים קטעים ריקים מראש, הדמיון לקול המבוקש יורד משמעותית.

שאלות
נפוצות

האם השימוש בעמוד כרוך בתשלום?

לא, הגישה חופשית לגמרי דרך הדפדפן. כל עוד השרת פועל, אין צורך במנוי או בתשלום כלשהו.

למה האפליקציה לא מגיבה כרגע?

העמוד מדווח על מצב RUNTIME_ERROR, כלומר שגיאת קוד פנימית שמונעת ממנו לעלות. עד שהיוצר לא יעדכן את הסביבה, הממשק לא יפיק אודיו.

אפשר להריץ את זה על המחשב שלי?

כן, הקוד פתוח תחת רישיון MIT ומשתמש בספריות מוכרות כמו transformers, librosa ו־torch. אפשר להוריד את הקבצים ולהריץ מקומית עם מעבד או כרטיס מסך.

איך משפרים את איכות התוצאה?

חשוב לחתוך קטעי שקט מקובץ הייחוס לפני שמעלים אותו. לפי יוצר ההדגמה, עודף שקט פוגע ביכולת לחלץ את מאפייני הקול בצורה מדויקת.

איך משתמשים

בוחרים גרסת מודל מתוך תפריט נפתח, מעלים את שני קבצי השמע או לוחצים על אחת הדוגמאות, ושולחים לעיבוד. ההדגמה פועלת עם תור מובנה. היא רצה על חומרת cpu-basic בסיסית, כך שעיבוד מודל כבד כמו WavLM לוקח זמן מורגש ולא קורה מיד. נכון לעכשיו העמוד מסומן בסטטוס של שגיאת ריצה, כך שהשרת כלל לא מתחיל לעבד קבצים עד שהתקלה תתוקן.

הרישיון

הקוד מופץ תחת רישיון MIT שמאפשר שימוש חופשי, כולל שינוי והפצה מסחרית. לגבי קבצי השמע שמעלים, הם מעובדים בממשק ציבורי פתוח ולא כדאי להעלות לשם הקלטות רגישות או פרטיות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗