GPT
T

tortoise-tts

רץ בדפדפן

Manmayapache-2.02023-09-21

  • gradio

היישום ממיר טקסט לקול מדובר בעל הבעה, ומיועד למי שרוצה לבדוק יצירת דיבור מקבצי טקסט או כתיבה חופשית. הוא נשען על המנוע של Tortoise יחד עם מודלים משלימים.

  • הורדות בחודש
  • 316לייקים

מה זה

מזינים פנימה טקסט ידנית לתיבה או מעלים קובץ טקסט עם תסריט שלם. בנוסף, בוחרים קול מרשימת אפשרויות קיימת, ואפשר גם לבחור קול נוסף לצורך שילוב, יחד עם הגדרה האם לפצל את התוכן לפי שורות חדשות. בסיום התהליך מקבלים נגן אודיו שמזרים את הדיבור שנוצר.

מאחורי הקלעים הקוד טוען שרשרת מודלים כבדה. המנוע המרכזי מבוסס על Tortoise TTS, לצד שילוב של bloom-560m, gpt2 של OpenAI, מודל tacotron-symbols, ושני מודלים ממשפחת wav2vec2 לעיבוד האודיו והדיבור. המבנה הזה נועד לחלק את הטקסט, לייצר את ההטעמה המתאימה ולבנות את גל הקול הסופי.

מתאים ל

  • הקראת תסריטים מקובץ

    מעלים קובץ טקסט מלא ומקבלים קובץ דיבור מפוצל לפי שורות.

  • בדיקת שילובי קולות

    בוחרים שני קולות שונים ברשימה ומייצרים דיבור מותאם אישית.

  • המרת משפטים לדיבור

    מקלידים טקסט קצר ישירות לתיבה ובודקים את אופי ההקראה.

איפה זה נופל

הבעיה המיידית היא שהיישום נמצא כעת במצב שגיאת ריצה ולא מייצר אודיו בכלל. מעבר לזה, חומרת t4-small חלשה יחסית למודלים כמו Tortoise ו־bloom, כך שגם כשהוא רץ, עיבוד של קובצי טקסט ארוכים דורש המתנה ממושכת. אם לא מספקים טקסט או קובץ, הקוד פשוט זורק שגיאה ועוצר.

שאלות
נפוצות

האם השימוש בחינם?

הגישה לעמוד פתוחה לגמרי ללא תשלום. עם זאת, נכון לעכשיו מופיעה בו תקלת ריצה שמונעת הפקה בפועל. כדי להשתמש בו יש צורך לשכפל את המרחב לחשבון אישי, מה שעשוי לדרוש חומרה בתשלום.

כמה זמן לוקח לייצר אודיו?

העיבוד של Tortoise ידוע כאיטי יחסית, במיוחד כשהוא פועל לצד מודלים נוספים כמו gpt2 ו־bloom. החומרה שהוקצתה כאן היא כרטיס t4-small, שמייצר זמני המתנה של דקות עבור פסקאות בודדות. כרגע המערכת לא עובדת בכלל עקב שגיאה.

האם אפשר להריץ אותו מקומית במחשב?

כן, הקוד מבוסס על ספריות פייתון פתוחות כמו gradio ו־torchaudio שמופיעות בקובץ app.py. אפשר להוריד את הקבצים ולהפעיל בסביבה עצמאית. תצטרכו כרטיס מסך עם מספיק זיכרון כדי להחזיק את כל המודלים במקביל.

מה קורה עם הטקסט והקבצים שמעלים?

הטקסט והקבצים נשלחים לעיבוד ישירות על השרת שמריץ את המרחב. הקוד מחלק את המלל ומייצר אודיו זמני לצורך הזרמה חזרה לדפדפן. אין עדות לשמירה קבועה במסד נתונים, אך המידע עובר דרך שרתי השירות.

איך משתמשים

בממשק כותבים טקסט או מעלים קובץ, בוחרים את הקולות מתיבות הבחירה ולוחצים על שליחה. היישום מוגדר להזרים את האודיו בחזרה עם השמעה אוטומטית כשהוא מוכן. החומרה שהוגדרה לו היא t4-small, כך שזמן העיבוד איטי למדי, במיוחד עם ריבוי המודלים ברקע. כרגע העמוד מדווח על תקלת ריצה, ולכן אי אפשר להפעיל אותו ישירות בדפדפן בלי תיקון של הקוד או שכפול שלו.

הרישיון

הפרויקט מפורסם תחת רישיון apache-2.0, שמאפשר שימוש חופשי, שינוי הקוד והפצה, כולל לצרכים מסחריים בכפוף לתנאי הרישיון. הקוד לא כולל הצהרה על שמירת הקבצים שאתם מעלים או האודיו שנוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗