GPT
P

parler-tts-mini-expresso

קוד פתוח

parler-ttsapache-2.02024-05-15

  • transformers
  • safetensors
  • parler_tts
  • text-generation
  • text-to-speech

המודל מייצר דיבור באנגלית מטקסט חופשי, עם שליטה ישירה ברגשות ובדוברים ספציפיים. הוא מיועד למי שמחפש קולות אקספרסיביים בלי להסתבך עם מודלי ענק.

  • 647Mפרמטרים
  • 2.4 GBמשקל הקבצים
  • 363הורדות בחודש
  • 117לייקים

מה זה

מדובר בגרסה מכווננת של parler-tts-mini v0.1 שאומנה על גבי מאגר Expresso, לצד דאטהסטים כמו Jenny ו־LibriTTS-R. במקום להסתפק בהקראה מונוטונית ונקייה, המודל מחווט להגיב לפרומפטים שמתארים רגש וסגנון דיבור, כך שניתן לבקש קול שמח, מבולבל, צוחק, לוחש או עצוב.

הייחוד כאן לעומת מודלים קלים אחרים הוא היכולת לנעול זהות קולית עקבית מתוך ארבעה שמות מוגדרים מראש: ג'רי ותומאס לגברים, טליה ואליזבת לנשים. בסיום האימון המודל הגיע לערך loss של 4.0, נתון שמראה התכנסות סבירה על דאטה משולב, אך הוא עדיין מוגבל ליכולות ההבעה שנלמדו מהסטים המקוריים בלבד.

מתאים ל

  • דיבוב דמויות במשחקים

    מאפשר לשלוט על רגשות כמו בלבול, צחוק או לחישה בהתאם להתרחשות בעלילה באנגלית.

  • פודקאסטים אוטומטיים מרובי משתתפים

    כולל ארבעה קולות קבועים של גברים ונשים ששומרים על זהות אחידה לאורך כל הפרק.

  • הקראת סיפורים וספרי שמע

    משלב הדגשת מילים באמצעות כוכביות ושימוש בסימני פיסוק לקביעת הפסקות נשימה וקצב.

איפה זה נופל

החיסרון הברור ביותר למפתח המקומי הוא השפה, המודל תומך באנגלית בלבד ולא מבין עברית. בנוסף, רשימת הדוברים העקביים מוגבלת לארבעת השמות שהוגדרו מראש, כך שאי אפשר להמציא דמויות חדשות יש מאין בלי לאמן מחדש.

שליטה ברגשות דורשת ניסוח מדויק בפרומפט כדי לא לקבל תוצאות מוזרות. מעבר לכך, המודל רגיש מאוד לסימני פיסוק לצורך קביעת קצב הדיבור, מה שמחייב ניקוי והכנה של הטקסט לפני השליחה.

שאלות
נפוצות

האם אפשר לייצר בעזרתו דיבור בעברית?

לא. המודל אומן על נתונים באנגלית בלבד. אם תזינו טקסט בעברית הוא ייכשל, ואין טעם לנסות להשתמש בו ישירות לשפה המקומית ללא אימון מחדש על דאטה מתאים.

איך שומרים על אותו קול בין משפטים שונים?

כוללים בפרומפט את אחד מארבעת השמות המובנים: Jerry, Thomas, Elisabeth או Talia. המודל שייך את השמות האלה לדוברים ממאגר האימון, וכך הוא שומר על אופי קול זהה בכל הפקה.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.4 גיגהבייט עם כ־647 מיליון פרמטרים, מה שמאפשר להריץ אותו בקלות על כרטיס מסך ביתי בודד עם 6 עד 8 גיגהבייט זיכרון, ואפילו על מעבד סביר אם לא חייבים זמני תגובה מיידיים. ההרצה נעשית ישירות דרך ספריית transformers של פייתון והספרייה הייעודית של הפרויקט.

אם אתם צריכים רק הקראת טקסט פשוטה באפליקציה קיימת, פנייה ל־API מסחרי תחסוך את כאב הראש של תחזוקת שרת. לעומת זאת, שווה להריץ אותו לבד אם אתם זקוקים לשליטה מקומית מלאה ברגשות הדובר, עבודה בלי תלות ברשת, או רצון לכוונן אותו על קולות נוספים בעזרת הקוד הפתוח שפורסם.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="parler-tts/parler-tts-mini-expresso")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון מתירני שמאפשר שימוש חופשי לחלוטין, כולל שילוב במוצרים מסחריים, שינוי הקוד והפצה פנימית או חיצונית, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗