GPT
M

mms-tts-eng

קוד פתוח

facebookcc-by-nc-4.02023-08-24

  • transformers
  • pytorch
  • safetensors
  • vits
  • text-to-audio

הפיכת טקסט באנגלית לאודיו בלי לסבך את השרת ובלי תלות בשירותי ענן חיצוניים. הוא שוקל פחות מ־300 מגה-בייט ומספק פתרון מקומי וזול במיוחד לבדיקות ולמחקר.

  • 36Mפרמטרים
  • 277 MBמשקל הקבצים
  • 161,553הורדות בחודש
  • 179לייקים

מה זה

מדובר במודל שממיר טקסט באנגלית לקול באופן ישיר, מקצה לקצה, על בסיס ארכיטקטורת VITS. הוא משלב מקודד טקסט, מודל זרימה ורכיב פענוח שמבוסס על HiFi-GAN כדי לייצר את גל הקול עצמו, בלי שתצטרכו לחבר לו מודל קול נפרד.

הייחוד כאן הוא הגודל המזערי של 36 מיליון פרמטרים בלבד. יש לו רכיב חיזוי משך סטוכסטי, מה שמאפשר לו לייצר קצב דיבור טבעי יותר מאותו משפט, אבל זה גם גורם לו לייצר תוצאה מעט שונה בכל פעם אלא אם כן מקבעים סיד בקוד.

מתאים ל

  • הקראת טקסט מקומית במחשב

    הוא שוקל 277 מגה-בייט בלבד ויכול לייצר קבצי wav פשוטים על מעבד רגיל בלי חיבור לרשת.

  • פרויקטי מחקר וניסויי אודיו

    הארכיטקטורה מבוססת VITS עם רכיב סטוכסטי, מה שמאפשר לבחון השפעות של קצבי דיבור על תוצאת הסינתזה.

  • בדיקות פיתוח פנימיות

    הקמה מהירה של סינתזת קול באנגלית מתוך קוד פייתון בלי לשלם על צריכת ענן.

איפה זה נופל

הנקודה הקריטית היא שהמודל לא דטרמיניסטי בגלל רכיב הניבוי הסטוכסטי שלו, ולכן חובה לקבע סיד אם אתם רוצים לקבל את אותו קובץ אודיו בדיוק מאותו טקסט. בנוסף, הוא מאומן ספציפית על אנגלית בלבד, ואי אפשר להשתמש בו לטקסט בעברית. הכרטיס גם לא מפרט תמיכה בדוברים שונים או שליטה בסגנון הדיבור.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה כדי להקריא טקסט בעברית?

לא. המשקל הספציפי הזה אומן אך ורק עבור השפה האנגלית. לפרויקט MMS יש מודלים נפרדים לשפות אחרות, אבל הקובץ הזה ייכשל על עברית.

למה אותו טקסט נשמע קצת שונה בכל הרצה?

המנגנון כולל מודול סטוכסטי שמחשב את משך ההגייה של כל הברה כדי לתת גיוון לקצב. כדי לקבל תוצאה זהה לחלוטין בכל פעם, צריך להגדיר סיד קבוע בקוד של פייתון לפני ההרצה.

האם המודל מותר לשימוש במוצר של סטארטאפ?

לא, הרישיון הוא CC-BY-NC 4.0 שמונע במפורש כל שימוש מסחרי. מותר להשתמש בו רק למחקר, לימודים או בדיקות פנימיות שלא מכניסות כסף.

איך מריצים

המודל רץ ישירות דרך ספריית transformers החל מגרסה 4.33, יחד עם accelerate. כל המשקל שלו הוא 277 מגה-בייט, כך שהוא לא דורש כרטיס מסך מפלצתי ויכול לרוץ בקלות גם על מעבד רגיל של מחשב נייד או שרת פשוט.

אם אתם רק צריכים בדיקות מקומיות או פיתוח במערכות סגורות, אין שום סיבה לשלם על API חיצוני. מצד שני, אם אתם מחפשים קולות מגוונים או תמיכה בריבוי דוברים מאותו קובץ, עדיף להסתכל על פתרונות אחרים.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="facebook/mms-tts-eng")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 277 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CC-BY-NC 4.0, מה שאומר שהוא מיועד אך ורק למחקר, ניסויים ושימוש לא מסחרי, ודורש מתן קרדיט. אסור בשום אופן לשלב אותו במוצר מסחרי או בשירות שמייצר הכנסה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗