GPT
M

MassivelyMultilingualTTS

רץ בדפדפן

Flux9665mit2024-02-26

  • gradio

הכלי מייצר דיבור מטקסט ביותר מ־7000 שפות ומאפשר שיבוט קול קצר ישירות בדפדפן. הוא מתאים למי שרוצה לבדוק דיבוב בשפות נדירות או לשחק עם פרמטרים של הגייה.

  • הורדות בחודש
  • 243לייקים

מה זה

מזינים טקסט בתיבה של שתי שורות ובוחרים שפה מתוך רשימת שפות עצומה שמבוססת על קובץ הגדרות של ToucanTTS. אפשר להעלות קובץ שמע כדי לשבט ממנו את הקול, או להשתמש בקול מלאכותי שנוצר במקום. בממשק יש סליידרים שקובעים את יצירתיות הפרוזודיה, את מהירות ההקראה בין פי 0.7 לפי 1.3, את הסיד של הקול ואת המגדר שלו בטווח שבין מינוס עשר לפלוס עשר.

בסיום מקבלים קובץ שמע לנגינה ולהורדה, לצד תמונה שמציגה ויזואליזציה של הדיבור. מאחורי הקלעים הקוד טוען כמה ספריות במקביל, כולל ToucanTTS, StableTTS, StyleTTS ומודל זיהוי הדובר של speechbrain מחבילת voxceleb כדי לנתח את השמע שנכנס לשיבוט.

מתאים ל

  • בדיקת הגייה בשפות נדירות

    מזינים משפטים קצרים בשפות אזוריות כדי לבדוק איך המודל מתמודד עם פונטיקה ייחודית.

  • יצירת דגימות קול מותאמות

    משחקים עם מדדי המגדר והמהירות כדי להפיק קול ייחודי בלי צורך בהקלטת שחקן.

  • שיבוט מהיר של דוברי שמע

    מעלים קובץ קול קצר ומקבלים הקראה של טקסט חדש תוך שמירה על מאפייני הדובר המקורי.

איפה זה נופל

ההבטחה של מעל 7000 שפות נשמעת מפתה, אבל בפועל איכות ההגייה בשפות עם מעט נתוני אימון עלולה להישמע רובוטית ולא אמינה. תיבת הטקסט בממשק מוגבלת לשתי שורות בלבד, כך שלא תוכלו להזין פסקאות ארוכות או מסמכים שלמים בלי לחתוך אותם ידנית. בנוסף, אם תעלו קובץ שמע באיכות גרועה עם רעשי רקע, מודל זיהוי הדובר יתקשה לבודד את המאפיינים ותקבלו עיוותים קשים בפלט.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, הגישה דרך הדפדפן חינמית לגמרי ואינה דורשת תשלום. המשאבים ממומנים על ידי תשתית השרתים הציבורית של הפלטפורמה. כל עוד החומרה זמינה, אפשר להשתמש בה בחופשיות.

כמה זמן לוקח לייצר קטע קול?

העיבוד עצמו לוקח שניות בודדות מרגע שהמערכת מתחילה לרוץ. מכיוון שמדובר בחומרת A10G שמוקצית דינמית, לפעמים יש המתנה קצרה בתור לפני תחילת העבודה. הטקסטים הקצרים שהממשק דורש מונעים זמני ריצה ארוכים.

מה קורה לקבצי הקול שאני מעלה לשיבוט?

הקבצים נשלחים אל השרת שמריץ את הממשק כדי שמודל הניתוח יוכל לחלץ את מאפייני הקול. הם לא נשמרים כמאגר קבוע שלכם, אבל הם עוברים ברשת ציבורית. לכן מומלץ לא להעלות הקלטות עם מידע רגיש או פרטי.

האם אפשר להריץ את הכלי הזה במחשב האישי?

כן, הקוד פתוח ברישיון MIT וניתן לשכפל אותו ולהריץ אותו מקומית. עם זאת, תצטרכו כרטיס מסך מתאים של אנבידיה עם מספיק זיכרון כדי להחזיק את כל המודלים הנדרשים בו זמנית. התקנת התלויות דורשת קצת ידע בפייתון ובסביבות עבודה של בינה מלאכותית.

איך משתמשים

לוחצים על כפתור ההפעלה אחרי שמגדירים את הטקסט והפרמטרים. האפליקציה רצה על חומרת zero-a10g של האגינג פייס, מה שאומר שכרטיס המסך מוקצה רק בזמן החישוב עצמו דרך ספריית spaces. העיבוד עצמו מהיר ברגע שההקצאה מתחילה, אבל בשעות עומס ייתכן שתמתינו כמה שניות עד שהחומרה תתעורר ותתפנה עבורכם. אין צורך בהתחברות או בהרשמה כדי להתחיל לעבוד.

הרישיון

הפרויקט מפורסם ברישיון mit חופשי לחלוטין. מותר לכם להשתמש בקוד ובתוצרים באופן חופשי, כולל שימוש מסחרי. עם זאת, קחו בחשבון שכל קובץ שמע שאתם מעלים או מפיקים נשלח לשרתי צד שלישי שבהם רץ הממשק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗