GPT
M

MegaTTS3-Voice-Cloning

רץ בדפדפן

mrfakenameרישיון לא דווח2024-03-08

  • gradio

מעלים הקלטת קול קצרה ומקבלים הקראה של טקסט חדש באותו הקול בדיוק. זה מיועד למי שרוצה לבדוק שכפול קול ישירות בדפדפן בלי להתקין סביבות עבודה כבדות.

  • הורדות בחודש
  • 304לייקים

מה זה

אתם מעלים קובץ שמע שמשמש כדוגמת קול ומקלידים בתיבת הטקסט את מה שתרצו להקריא. הממשק מעבד את הקובץ באמצעות ספריות librosa ו־pydub, חותך ומנרמל את האודיו, ומפיק קובץ שמע חדש של הדיבור המשוכפל.

מאחורי הקלעים רץ שילוב מעניין. מודל MegaTTS 3 אומן במקור על ידי ByteDance, אך המפתחים המקוריים לא שחררו את רכיב ה־WavVAE הדרוש לשכפול. יוצר האפליקציה שילב מקודד WavVAE לא רשמי שפותח בנפרד, ובכך חיבר את החלק החסר שמאפשר להזין דגימת קול חיצונית למודל.

בנוסף לשדות הבסיסיים, יש תפריט מתקדם עם פרמטרים מספריים כמו infer_timestep, p_w ו־t_w שמשפיעים ישירות על תהליך הדגימה והחישוב של המודל.

מתאים ל

  • בדיקת שכפול קול זריזה

    מזינים קטע דיבור קיים וטקסט קצר כדי לראות תוך דקה איך MegaTTS 3 מתמודד עם גוון הקול שלכם.

  • השוואת ביצועי מודלים

    בודקים את איכות הפלט מול פתרונות קוד פתוח מקבילים כמו F5-TTS שמוזכר גם הוא בסביבה.

  • מחקר והתנסות בהגדרות

    משנים ערכים מספריים בתפריט המתקדם כדי להבין איך שינוי צעדי הדגימה משפיע על הצליל שנוצר.

איפה זה נופל

אם לא תזינו גם קובץ שמע וגם טקסט, המערכת פשוט תקפיץ אזהרה ותסרב לעבוד. הקוד כולל טיפול מפורש בשגיאות זיכרון של כרטיס המסך (CUDA errors), מה שמלמד שהרצות מסוימות עלולות לקרוס ולדרוש איפוס מלא של המודל. בנוסף, המפתח עצמו מציין במפורש בדף שלא מדובר בפתרון השכפול הטוב ביותר, אלא בניסוי שעובד היטב רק בתרחישים מסוימים.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, הגישה לדמו פתוחה בחינם בדפדפן. היא רצה על תשתית שיתופית ולכן אין צורך במנוי או בהזנת כרטיס אשראי.

מה קורה עם קובצי השמע שאני מעלה?

הקבצים נשלחים לשרת לצורך העיבוד, הנירמול והפקת הדיבור. מאחר שלא הוגדר רישיון מסודר ולא נמסרו התחייבויות פרטיות, מומלץ לא להעלות הקלטות רגישות או מידע אישי.

האם אפשר להריץ את זה על המחשב שלי?

הקוד מבוסס על ספריות פייתון סטנדרטיות ומודל ששמור במאגר פתוח, אך הוא דורש מעבד גרפי תומך CUDA והגדרת סביבה מתאימה. הדף הנוכחי חוסך את ההתקנה הזו ומריץ הכל בענן.

מדוע המפתח השתמש במקודד לא רשמי?

יוצרי המודל המקוריים ב־ByteDance לא פרסמו את רכיב ה־WavVAE, ולכן אי אפשר היה לבצע שכפול קול ישיר עם המודל הרשמי בלבד. המפתח שילב מקודד חיצוני כדי לעקוף את המגבלה הזו.

איך משתמשים

לוחצים על כפתור Generate Speech אחרי שמזינים את האודיו והטקסט. הדף רץ על חומרת zero-a10g שמקצה מעבד גרפי של Nvidia מדגם A10G לפי דרישה, כך שזמן העיבוד תלוי בזמינות המשאבים של Hugging Face ובאורך הקטע שתנסו לייצר. אין צורך בהתחברות מיוחדת או בהרשמה כדי להריץ את הדמו.

הרישיון

הרישיון של היישום לא דווח כלל במאגר. במצב כזה אין הרשאה ברורה לשימוש מסחרי, וכל מה שמעלים או מפיקים נשאר מוגבל לשימוש לימודי ולמחקר, כפי שמבקש גם המפתח בעמוד עצמו.

הרישיון המלא ב־Hugging Face ↗