GPT
M

Multi-voice-TTS-GPT-SoVITS

רץ בדפדפן

Ailythmit2024-02-15

  • gradio

הממשק מייצר דיבור באנגלית, סינית ויפנית באמצעות מודלים קיימים או דגימת קול קצרה. הוא מיועד למי שמחפש שכפול קול מהיר בלי להגדיר סביבת עבודה מקומית.

  • הורדות בחודש
  • 150לייקים

מה זה

מזינים טקסט באנגלית, סינית או יפנית, ובוחרים מודל מוכן מתוך רשימה שמחולקת לפי שפות, או שמעלים הקלטת קול של 3 עד 10 שניות לשכפול ישיר. התוצאה היא קובץ אודיו להאזנה ולהורדה. הממשק כולל אפשרויות לחיתוך הטקסט, כוונון עוצמת השמע בין 0.5 ל־2, וכפתורי הגרלה לטקסטים מוכנים. בדגמים המוכנים יש גם אפשרות לבחור טון דיבור ולהאזין לדגימה מקדימה שלו לפני ההפקה, כאשר בין האפשרויות המובנות באנגלית מופיע קול של טראמפ.

מאחורי הקלעים רצה ארכיטקטורת GPT-SoVITS יחד עם מודלים משלימים. העיבוד והתמלול נעזרים במודל Whisper Tiny של OpenAI, מודל השפה הסיני Chinese RoBERTa של HFL, ומחלץ המאפיינים הקוליים HuBERT של Tencent. המערכת מחלקת את הטקסט לרצפים ומזהה את השפה אוטומטית בעזרת רכיבי שפה ייעודיים.

מתאים ל

  • שכפול קול מקובץ קצר

    העלאת הקלטה באורך מספר שניות כדי לחקות את גוון הקול עבור טקסט מותאם אישית.

  • דיבוב דמויות מוכנות

    בחירת פרופיל קול מוגדר מראש באנגלית, סינית או יפנית להקראת תסריטים.

  • הפקת דיבור דרך קולאב

    מעבר למחברת החיצונית שמקושרת מהקוד לצורך הרצה על גבי מאיץ גרפי ייעודי.

איפה זה נופל

החיסרון המרכזי הוא שהדף כלל אינו עובד וזורק שגיאה בעלייה. מעבר לכך, אין שום תמיכה בעברית, והאפשרויות מוגבלות רק לאנגלית, סינית ויפנית. מי שבונה על הפקת כמויות של דיבור ייתקל במגבלות אורך הטקסט שהוגדרו מראש בתיבות הקלט. מודל הבסיס של GPT-SoVITS מסוגל להפיק איכות גבוהה, אך ההגדרה על גבי מעבד פשוט הופכת הפקה מעשית לבלתי שמישה בלי כרטיס מסך חיצוני.

שאלות
נפוצות

האם אפשר להשתמש באפליקציה בחינם?

הגישה דרך הדפדפן היא ללא תשלום, ואין דרישה להזנת פרטי אשראי. עם זאת, נכון לעכשיו השירות מושבת בגלל תקלת תוכנה בעלייה. מי שרוצה להשתמש בו צריך להפעיל את המחברת המקושרת בקולאב.

האם יש תמיכה בהקראת עברית?

האפליקציה אינה תומכת בעברית כלל. המודלים ומנגנוני זיהוי השפה מוגדרים לעבוד אך ורק עם אנגלית, סינית ויפנית. הזנת אותיות בעברית לא תניב תוצאה תקינה.

מה קורה עם הקבצים וההקלטות שמעלים לממשק?

הקבצים נשלחים לשרת שבו רץ הממשק לצורך ניתוח הגל והפקת הדיבור. מדובר בסביבה פומבית בהאגינג פייס, ולכן לא מומלץ להעלות לשם הקלטות קול רגישות או פרטיות. לאחר תום הריצה הקבצים מעובדים באופן זמני בלבד.

האם אפשר להריץ את הכלי ישירות על המחשב?

הקוד מבוסס על ספריות פתוחות ופרויקט GPT-SoVITS, כך שניתן לשכפל את המאגר ולהריץ אותו באופן מקומי. בשביל לקבל קצב סביר יש צורך במחשב עם כרטיס מסך מתאים של אנבידיה. הרצה מקומית על מעבד בלבד תהיה אטית להחריד.

איך משתמשים

בוחרים דמות מוכנה או מקליטים קול קצר, מדביקים טקסט בתיבה ולוחצים על כפתור ההפקה או השכפול. בפועל האפליקציה נמצאת כעת במצב של שגיאת ריצה, כך שהיא כלל לא עולה בדפדפן ולא מייצרת אודיו. בעמוד מוטמע קישור למחברת גוגל קולאב שמיועדת להרצה חלופית. חומרת הבסיס שהוגדרה לה היא מעבד פשוט ללא מאיץ גרפי, כך שגם אם השרת היה מגיב, עיבוד מודלים כאלה על מעבד בלבד גורר זמני המתנה ממושכים מאוד לכל משפט.

הרישיון

הקוד מפורסם תחת רישיון MIT, שמאפשר שימוש חופשי, שינוי והפצה כולל למטרות מסחריות. הרישיון חל על קוד הממשק עצמו. המודלים המשובצים וההקלטות שמעלים עשויים להיות כפופים למגבלות שימוש נפרדות של יוצריהם המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗