GPT
M

MARS5-TTS

קוד פתוח

CAMB-AIagpl-3.02024-06-07

  • mars5-tts
  • text-to-speech
  • audio
  • speech
  • voice-cloning

מודל הקראת טקסט באנגלית שמתמחה בפרוזודיה מורכבת ומאפשר שכפול קול לפי דגימה קצרה. השליטה בהדגשות נעשית ישירות דרך סימני פיסוק ואותיות גדולות בטקסט.

  • 2.3 GBמשקל הקבצים
  • 164הורדות בחודש
  • 480לייקים

מה זה

הארכיטקטורה כאן מחולקת לשני שלבים שונים: מודל אוטורגרסיבי של 750 מיליון פרמטרים שמייצר מאפייני דיבור גסים, ומודל דיפוזיה לא אוטורגרסיבי של 450 מיליון פרמטרים שמלטש אותם לקודבוק של אנקודק לפני המעבר לווקודר. השילוב הזה נועד להתמודד עם דיבור חי, מהיר ומלא רגש כמו פרשנות ספורט או דיבוב אנימה, תחומים שבהם מודלים רגילים נוטים להישמע מונוטוניים ורובוטיים.

השליטה באינטונציה עובדת דרך הטקסט עצמו בזכות טוקנייזר ברמת הבייטים. פסיק מוסיף השהיה, ומילים באותיות גדולות מקבלות הדגשה ועוצמה. לשכפול קול מספיקה דגימת אודיו נקייה באורך של שתיים עד שתים עשרה שניות, כשאזור שש השניות נותן את התוצאה הטובה ביותר. אם מצרפים גם את התמלול המדויק של דגימת המקור, המערכת מבצעת תהליך עיבוד עמוק ואיכותי יותר.

מתאים ל

  • דיבוב סצנות אנימה

    מאפשר הפקת קולות דרמטיים ומלאי הבעה שמשתנים לפי סימני פיסוק ואותיות גדולות בטקסט.

  • קריינות ספורט ממוחשבת

    מסוגל לעמוד בקצב מהיר ובאינטונציה מתפרצת על בסיס דגימת שמע קצרה של שש שניות.

  • שכפול קול לפודקאסטים

    מצב ההסקה העמוק מאפשר לחקות דובר קיים באנגלית באמצעות הקלטה של מספר שניות ותמלולה.

איפה זה נופל

היוצרים מודים בגלוי ביציבות ובעקביות בעייתיות בהפקה, כך שאותו קלט עשוי להניב לפעמים תוצאה מעולה ולפעמים פלט מקרטע. חסרים מדדי ביצועים מסודרים מול מאגרי בדיקה סטנדרטיים, כך שקשה לדעת מראש איך הוא ישתווה למתחרים בלי בדיקה עצמאית. בנוסף, הוא מתקשה לבחור קטעים מתוך דגימות קול ארוכות מדי, ותומך בקוד הפתוח בשפה האנגלית בלבד, כך שאין כאן מענה ישיר למי שמחפש עברית בהרצה מקומית.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי של 8GB?

לא, המודל דורש לפחות 20GB של זיכרון גרפי בגלל הרצת שני החלקים בפורמט של 16 ביט. בחומרה חלשה יותר התהליך יקרוס מחוסר זיכרון, ובמצב כזה עדיף לפנות לגרסת השרת דרך ה־API שלהם.

האם המודל הפתוח מסוגל להקריא טקסט בעברית?

לא, המשקלים והטוקנייזר שפורסמו במאגר הזה אומנו עבור השפה האנגלית בלבד. החברה מציעה תמיכה ביותר ממאה וארבעים שפות אך ורק דרך השירות המסחרי הסגור שלה.

מה ההבדל בין שכפול קול מהיר לשכפול עמוק?

השכפול המהיר מסתפק בקובץ הקול בלבד ומייצר דיבור במהירות על חשבון הדיוק. השכפול העמוק דורש מכם להזין גם את הטקסט שנאמר בהקלטה, לוקח יותר זמן ריצה, אך שומר טוב יותר על אופי הקול המקורי.

איך מריצים

כדי להריץ מקומית צריך כרטיס מסך עם לפחות 20GB של זיכרון גרפי, משום ששני החלקים תופסים יחד 1.2 מיליארד פרמטרים וההסקה מתבצעת בנקודה צפה של 16 ביט. ההתקנה דורשת פייתון 3.10 ומעלה ופייטק 2.0 ומעלה, לצד חבילות כמו אנקודק, ווקוס וליברוסה. הטעינה נעשית דרך טורץ' האב ללא צורך בשכפול הקוד ידנית.

יש שני מצבי הפעלה: מצב רדוד ומהיר שלא דורש תמלול של דגימת הקול, ומצב עמוק ואיטי שמחייב תמלול אך מפיק דיוק גבוה בהרבה. אם אין ברשותכם חומרה ייעודית כזו, CAMB-AI מספקים גישה לאותו מודל דרך ממשק תכנות מרוחק בתשלום.

pip install -U huggingface_hub
hf download CAMB-AI/MARS5-TTS

הרישיון

הקוד והמשקלים שוחררו תחת רישיון GNU AGPL 3.0. מותר להשתמש במודל לצרכים מסחריים, אבל אם אתם משלבים אותו בשירות רשת או מוצר שפונה למשתמשים, אתם מחויבים לחשוף את כל קוד המקור של המוצר שלכם תחת אותו רישיון בדיוק. CAMB-AI מציינים שמי שרוצה לשלב את המודל במוצר סגור צריך לפנות אליהם כדי לרכוש רישיון מסחרי חלופי.

הרישיון המלא בעמוד המודל ↗