GPT
M

MegaTTS3

קוד פתוח

ByteDanceapache-2.02025-03-28

  • safetensors
  • text-to-speech
  • en
  • zh

המודל הזה משבט דיבור באנגלית ובסינית על בסיס דגימת קול קצרה. הוא מתאים למי שמחפש שליטה ברמת המבטא ובמידת הדמיון לקול המקורי.

  • 4.0 GBמשקל הקבצים
  • 560הורדות בחודש
  • 418לייקים

מה זה

מדובר במודל שמשלב מנגנון Latent Diffusion Transformer עם יישור קולי לצורך סינתזת דיבור מאפס. הוא מציע פתרון המאפשר לחקות קולות של דוברים קיימים, תוך שמירה על הבעה רגשית או התאמת הגייה תקנית לעומת מבטא מקורי. לפי התיעוד, הארכיטקטורה מתבססת על WavTokenizer לייצוג אקוסטי דיסקרטי ומכילה מודלים נוספים לשיפור היציבות.

הייחוד כאן הוא השליטה הישירה בפרמטרים של מובנות לעומת דמיון לקול המקור בעזרת משקלים מוגדרים מראש. זה מאפשר למשל לשמר מבטא זר של דובר אנגלי כשהוא מקריא טקסט בסינית, או לחלופין לתקן את ההגייה לכיוון תקני. המודל שוקל ארבעה גיגה בייט בלבד, מה שהופך אותו לקל יחסית להורדה ולשילוב.

מתאים ל

  • הקראת טקסט רב לשונית

    שילוב קול קיים באנגלית להקראת משפטים בסינית, תוך שמירה על המבטא המקורי של הדובר.

  • מחקר אקדמי בסינתזה

    בדיקת אלגוריתמים של יישור קולי ודיפיוז'ן בעזרת הדגימות והמשקולות המוכנות מראש.

  • דיבוב מותאם עם קולות קבועים

    הפקת דיבור רגשי באנגלית או סינית עבור דמויות קבועות שמערכי המאפיינים שלהן כבר הוכנו.

איפה זה נופל

המגבלה המרכזית פוסלת אותו כמעט לכל מוצר מסחרי רגיל. מטעמי אבטחה, בייטדאנס לא שחררו את משקלי הקידוד של מודל השמע. בפועל אי אפשר לקחת קובץ קול חדש של משתמש ולהפיק ממנו דיבור, אלא חייבים להשתמש בקובצי מאפיינים שהוכנו מראש בתיקיית גוגל דרייב של הפרויקט, או להגיש להם בקשה ידנית להפקת קובץ כזה. בנוסף, הוא תומך באנגלית ובסינית בלבד, כך שאין שום תמיכה בעברית.

שאלות
נפוצות

האם המודל יודע להקריא טקסט בעברית?

לא. המודל אומן ותומך בשפות אנגלית וסינית בלבד. אין לו תמיכה בטקסט או בפונטיקה עברית.

אפשר להעלות קובץ הקלטה של לקוח ולשבט אותו מיד?

לא, וזה המכשול המרכזי כאן. המקודד הנחוץ להפקת המאפיינים מקובץ שמע חדש אינו מצורף להורדה. אפשר להשתמש רק בקולות שבייטדאנס קידדו מראש או להעלות קובץ לאישורם בתור אקדמי.

איזו חומרה מומלצת להרצה סבירה?

מומלץ להשתמש במעבד גרפי תומך קודה. על מעבד רגיל עשרה צעדי הסקה נמשכים כחצי דקה, מה שלא מתאים לזמן אמת.

איך מריצים

כדי להריץ אותו מקומית צריך סביבת פייתון 3.10 או תמונת דוקר לפי ההנחיות בריפו של בייטדאנס. הוא תומך בהרצה על כרטיסי מסך וגם על מעבד, אבל הרצה על מעבד איטית מאוד ונמשכת סביב שלושים שניות לעשרה צעדי הסקה בלבד. קריאה משורת הפקודה דורשת קובץ אודיו של קול המקור לצד קובץ מאפיינים תואם.

לפני שממהרים להרים שרת עצמאי, צריך לזכור שאין כאן אפשרות לעבד קולות חדשים ישירות בקוד המקומי בגלל היעדר מקודד. אם אתם זקוקים לשיבוט דינמי של כל משתמש בזמן אמת, מודל כזה ידרוש מכם תלות בתהליך חיצוני, ובמקרה כזה שירותי ענן מוכנים יחסכו את הסיבוך.

pip install -U huggingface_hub
hf download ByteDance/MegaTTS3

הרישיון

הפרויקט פורסם תחת רישיון אפאצ'י שתיים אפס, שמתיר שימוש מסחרי, שינוי והפצה חופשית של הקוד והמשקלים. עם זאת, היוצרים מדגישים בתיעוד שהמיזם מכוון בעיקר למטרות אקדמיות. כל עוד אתם מוגבלים לקולות שהם קידדו מראש, הרישיון המשפטי המתירני לא פותר את המחסום התפעולי במוצר סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗