GPT
T

tts-tacotron2-ljspeech

קוד פתוח

speechbrainapache-2.02022-05-28

  • speechbrain
  • text-to-speech
  • TTS
  • speech-synthesis
  • Tacotron2

הפיכת טקסט קצר באנגלית לספקטרוגרמת שמע עם ארכיטקטורה מוכרת. הוא שוקל רק 108 מגהבייט ומתאים למי שמחפש פתרון קל להרצה עצמית דרך פייתון.

  • 108 MBמשקל הקבצים
  • 5,639הורדות בחודש
  • 139לייקים

מה זה

מדובר במימוש של ארכיטקטורת טקוטרון שתיים על גבי ספריית ספיצ'בריין, שאומן על מערך הנתונים המוכר אל ג'יי ספיץ'. המודל מקבל משפט קצר באנגלית ופולט ספקטרוגרמה של תדרי מל. חשוב להבין שהוא לא מייצר קובץ אודיו שמסוגל להתנגן באופן ישיר, אלא רק את המיפוי המתמטי של גלי הקול. כדי לקבל צליל אמיתי, מחברים אליו מודל ווקודר חיצוני, כמו הייפיי גאן, שממיר את התוצאה לאות שמע.

הגודל שלו, כמאה ושמונה מגהבייט בלבד בחמישה קבצים, הופך אותו לפתרון קל משקל ביחס למודלים מודרניים של דיבור. הוא שוחרר באמצע שנת 2022 כחלק ממאמצי המחקר הפתוח סביב ספיצ'בריין. היתרון העיקרי כאן הוא הפשטות והשליטה המלאה בקוד, ללא שכבות מורכבות של מערכות ענק מסחריות.

בכרטיס המודל אין מדדי דיוק מספריים או תוצאות מבחני איכות סטנדרטיים, אך יש קישור ישיר ליומני האימון המלאים. בפועל, המשמעות היא שרמת הדיוק ואיכות ההגייה נשענות ישירות על התכונות של מערך הנתונים המקורי, שכולל קריינות נשית יחידה בשפה האנגלית בלבד.

מתאים ל

  • הקראת ממשק באנגלית

    מתאים לשילוב קול נשי באנגלית במערכות מקומיות בזכות גודל קובץ זעיר של מאה ושמונה מגהבייט.

  • פיתוח ומחקר שמע

    בסיס נוח לניסויים בספריית ספיצ'בריין ובדיקת שרשראות עיבוד קול יחד עם ווקודרים שונים.

  • המרת אצוות טקסט מקומית

    מאפשר לעבד רשימות של משפטים קצרים בלולאה אחת ישירות דרך מעבד רגיל וללא עלויות ענן.

איפה זה נופל

הבעיה המרכזית היא שהמודל לא מייצר אודיו שלם לבד ומחייב שרשור של ווקודר נפרד, מה שמוסיף מורכבות לתהליך. בנוסף, הוא אומן רק על קול בודד באנגלית ולא תומך בעברית כלל. יוצרי הכלי מצהירים במפורש שאין שום אחריות על ביצועי המודל בשימוש על מערכי נתונים אחרים.

שאלות
נפוצות

האם המודל מסוגל לייצר דיבור בעברית?

לא. המודל אומן אך ורק על מערך הנתונים אל ג'יי ספיץ', שכולל הקלטות באנגלית בלבד. כל ניסיון להזין לו תווים בעברית לא יעבוד.

האם מקבלים קובץ שמע ישירות מהרצת המודל?

לא, המודל פולט ספקטרוגרמת מל שהיא ייצוג תדרים בלבד. כדי להפיק קובץ נגן, חובה להעביר את הפלט דרך מודל ווקודר נפרד כמו הייפיי גאן.

איך מריצים

ההתקנה דורשת את חבילת ספיצ'בריין וטורצ'אודיו בסביבת פייתון. המודל נטען ישירות מהמאגר המקוון, מקבל מחרוזת טקסט ומחזיר את נתוני הספקטרוגרמה. כדי לייצר קובץ שמע, מעבירים את הפלט לווקודר ושומרים את הגל בתדר של עשרים ושניים אלף וחמישים הרץ.

המשקל המזערי מאפשר להריץ אותו בקלות על כל מעבד מודרני בלי להזדקק לכרטיס מסך ייעודי. עם זאת, אם רוצים לעבד כמויות גדולות של טקסט או להשתמש בו בסביבת ייצור עמוסה, אפשר להגדיר הרצה על גבי קודה. אין כאן מדרגות מחיר, אבל מי שצריך תמיכה בריבוי שפות או קולות שונים יעדיף שירות חיצוני מנוהל.

pip install -U huggingface_hub
hf download speechbrain/tts-tacotron2-ljspeech

הקבצים

5 קבצים במאגר, 108 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו במוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים קרדיט למחקר של ספיצ'בריין.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗