GPT
T

tts-hifigan-ljspeech

קוד פתוח

speechbrainapache-2.02022-05-28

  • speechbrain
  • Vocoder
  • HiFIGAN
  • text-to-speech
  • TTS

ווקודר קל משקל שממיר ספקטרוגרמות לקובצי שמע בקצב דגימה של 22050 הרץ. הוא מיועד למי שכבר מייצר ספקטרוגרמות באנגלית וצריך להפוך אותן לגלי קול מהר ובלי שרתים כבדים.

  • 53.6 MBמשקל הקבצים
  • 5,841הורדות בחודש
  • 39לייקים

מה זה

מדובר במימוש של HiFiGAN דרך ספריית SpeechBrain, שכל תפקידו הוא לקחת ספקטרוגרמה ולהוציא ממנה קובץ קול שמיע. הוא לא מקבל טקסט ישירות, אלא יושב בקצה של צנרת עיבוד דיבור, לרוב אחרי מודל קודם כמו Tacotron2 שמייצר את הספקטרוגרמה מהטקסט.

המודל אומן על מאגר LJSpeech, מה שאומר שהוא מכיר דוברת אחת בלבד ומותאם לשפה האנגלית. המשקל הכולל שלו עומד על 53.6 מגה בייט בלבד, כך שהוא פתרון זעיר ומהיר מאוד ביחס למודלים מודרניים אחרים, אך הוא מוגבל אך ורק לפורמט השמע ולתדרי הדגימה של הנתונים שעליהם אומן.

מתאים ל

  • ווקודר לצנרת TTS באנגלית

    שלב אחרון שממיר ספקטרוגרמה של טקסט באנגלית מול מודל Tacotron2 לקול אנושי.

  • עיבוד שמע מקומי ומהיר

    הפקת גלי קול מקבצי ספקטרוגרמה ישירות על מעבד רגיל ובלי צורך בשרתי GPU ייעודיים.

  • אימון ובדיקות במחקר

    שימוש בסקריפטים ובמשקלים המוכנים של SpeechBrain כדי לבחון איכות שמע בקצב 22050 הרץ.

איפה זה נופל

המודל אומן על דוברת אחת בלבד, ויוצריו מציינים בפירוש שעבור קולות שונים עדיף לפנות למודלים אחרים שאומנו על מספר דוברים, כמו אלה המבוססים על LibriTTS. בנוסף, הוא פועל בקצב של 22050 הרץ בלבד ולא מתאים למי שצריך תדר של 16000 הרץ בלי לבצע דגימה מחדש. עברית בכלל לא נתמכת כאן, והוא אינו מסוגל לקרוא טקסט עצמאית אלא תלוי לחלוטין במודל מקדים שמספק לו ספקטרוגרמה תקינה.

שאלות
נפוצות

האם המודל מקבל טקסט ישירות ומוציא שמע?

לא. זהו ווקודר בלבד שמקבל ספקטרוגרמה ופולט גל קול. כדי לקבל שמע מטקסט צריך להריץ לפניו מודל נפרד, כמו Tacotron2, שייצר את הספקטרוגרמה.

האם אפשר להשתמש בו לדיבוב של כמה דוברים שונים?

עדיף שלא. המודל אומן על דוברת יחידה ממאגר LJSpeech ולכן התוצאה על קולות אחרים תהיה מוגבלת, כשהיוצרים עצמם ממליצים על גרסאות LibriTTS למספר דוברים.

איך מריצים

ההרצה נעשית בפייתון ישירות מקוד המקור בעזרת הספרייה speechbrain וקריאה של שורות בודדות דרך HIFIGAN.from_hparams. אפשר להריץ אותו ישירות על מעבד רגיל או להעביר אותו לכרטיס מסך על ידי הגדרת run_opts עם cuda.

בגלל המשקל הזעיר של 53.6 מגה בייט אין שום סיבה לשלם על API חיצוני רק בשבילו, והוא ירוץ בקלות על כל שרת בסיסי בלי צורך בחומרה יקרה.

pip install -U huggingface_hub
hf download speechbrain/tts-hifigan-ljspeech

הקבצים

5 קבצים במאגר, 53.6 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה מחדש בתוך מוצרים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗