GPT
M

MeloTTS

רץ בדפדפן

mrfakenamemit2024-02-25

  • gradio

הופך טקסט מוקלד לקובץ שמע בכמה שפות זרות ומיועד למי שרוצה לבדוק דיבוב מהיר ישירות מהדפדפן. הממשק נותן לשמוע תוצאה תוך שניות בלי התקנות.

  • הורדות בחודש
  • 481לייקים

מה זה

אתם כותבים או מדביקים משפט בתיבת הטקסט, בוחרים שפה ודובר מתוך הרשימה, וקובעים את מהירות ההקראה בסליידר שנע בין 0.1 ל־10. בלחיצה אחת מקבלים נגן עם קובץ שמע מוכן להאזנה ולהורדה. יש בממשק טקסט ברירת מחדל באנגלית שמציג דוגמה ראשונית מיד כשפותחים אותו.

מאחורי הקלעים רצה הספרייה MeloTTS יחד עם מודלים ייעודיים לשפות שונות, כולל גרסאות אנגלית מרובות כמו myshell-ai/MeloTTS-English-v3 ומודלים של BERT לצרפתית, ספרדית, קוריאנית וסינית כדי לעבד את הטקסט. הגישה הזו משלבת עיבוד שפה מקדים שמסייע בהגייה מדויקת של המילים לפני הפקת גל הקול.

מתאים ל

  • הקראת טקסטים באנגלית

    מזינים פסקאות באנגלית ומייצרים קובצי דיבוב נקיים להאזנה מהירה או לקריינות פשוטה.

  • בדיקת מבטאים ודוברים

    מחליפים בין קולות שונים באנגלית או בשפות אירופיות כדי לבחור את הטון המתאים לפרויקט.

  • הפקת שמע להוראת שפות

    יוצרים דוגמאות הגייה ברורות בספרדית, צרפתית, סינית או קוריאנית במהירויות דיבור שונות.

איפה זה נופל

החיסרון המרכזי כאן הוא היעדר מוחלט של עברית, כך שהכלי חסר תועלת לטקסטים מקומיים ותומך רק באנגלית, ספרדית, צרפתית, סינית, יפנית וקוריאנית. בנוסף, זו הדגמה לא רשמית שלא כוללת אפשרויות מתקדמות כמו שכפול קול מקובץ חיצוני או שליטה באינטונציה מעבר למהירות הדיבור הפשוטה.

שאלות
נפוצות

האם השימוש בהדגמה הזו עולה כסף?

לא, הגישה דרך הדפדפן חינמית לחלוטין. אין צורך להזין פרטי תשלום או לפתוח משתמש כדי לייצר קובצי קול.

האם יש תמיכה בהקראת עברית?

לא, אין במערכת מודל לעברית. האפשרויות מוגבלות לאנגלית, ספרדית, צרפתית, סינית, יפנית וקוריאנית בלבד.

האם מדובר בגרסה הרשמית של המודל?

לא, מדובר בהדגמה עצמאית ולא רשמית שנבנתה על ידי משתמש בשם mrfakename על בסיס הספרייה הפתוחה. היא מציגה את יכולות הבסיס אך לא כוללת את כל כלי הפיתוח של הפרויקט המקורי.

כמה זמן לוקח לייצר קובץ שמע?

העיבוד לוקח שניות בודדות בלבד מרגע הלחיצה. מאחר שהמערכת מנצלת מעבד גרפי מסוג a10g, הפקת השמע מהירה מאוד גם על משפטים ארוכים.

איך משתמשים

בוחרים אחת משש השפות הזמינות, משנים דובר ומהירות אם רוצים, ולוחצים על Synthesize. היישום רץ על תשתית חומרה של zero-a10g שמשתמשת במעבד גרפי לפי דרישה, כך שזמן העיבוד קצר מאוד ולא דורש הרשמה או חיבור לחשבון. לפעמים יש המתנה קלה כשהמשאב הגרפי מתעורר לפעולה, אבל יצירת השמע עצמה מתבצעת כמעט מיד.

הרישיון

הפרויקט מופץ ברישיון mit פתוח ומתירני, שמאפשר שימוש חופשי בקוד ובתוצרים כולל לצרכים מסחריים. הטקסט שאתם מזינים והשמע שנוצר מנוהלים ישירות מול היישום ברשת, ללא הצהרת פרטיות מיוחדת מעבר לתנאי השימוש הרגילים בפלטפורמה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗