GPT
P

parler-tts-mini-v1

קוד פתוח

parler-ttsapache-2.02024-06-26

  • transformers
  • safetensors
  • parler_tts
  • text-generation
  • text-to-speech

הפקת דיבור באנגלית שנשלטת ישירות מתיאור טקסטואלי, מקצב ועד רעשי רקע. פתרון קל משקל שרץ מקומית בלי תלות בספקי ענן חיצוניים.

  • 878Mפרמטרים
  • 3.3 GBמשקל הקבצים
  • 16,966הורדות בחודש
  • 153לייקים

מה זה

המודל ממיר טקסט לדיבור באנגלית על בסיס אימון של 45 אלף שעות אודיו. הייחוד כאן הוא השליטה. במקום לבחור רק קובץ קול מוכן, אתם מתארים במילים איך הדובר צריך להישמע, כולל מגדר, מהירות דיבור, גובה קול, הד ואפילו רמת רעש ברקע. כדי לייצר עקביות, שילבו בו 34 דוברים קבועים עם שמות מוגדרים, כך שאפשר לחזור לאותו קול בדיוק על ידי ציון השם בתיאור.

מדובר בשחזור פתוח לחלוטין של מחקר מבית Stability AI ואוניברסיטת אדינבורו. בשונה מפרויקטים סגורים או סמי פתוחים, כאן שוחררו המשקלים, קוד האימון וקוד עיבוד הנתונים. בגודל של כ־878 מיליון פרמטרים, הוא מציע פשרה טובה בין איכות פלט לבין צריכת משאבים סבירה.

מתאים ל

  • הפקת קריינות מותאמת

    מאפשר לשלוט ברמת ההד, המהירות והרעש כדי להתאים את הקול המוקלט לסצנה בלי עריכת סאונד.

  • דיבוב דמויות קבועות

    34 הדוברים המובנים מאפשרים לייצר רצף קולי אחיד לאותה דמות לאורך קטעי טקסט שונים.

  • אימון קולות חדשים

    הקוד הפתוח וכלי עיבוד הנתונים מאפשרים להמשיך את האימון על מאגרי אודיו ייעודיים משלכם.

איפה זה נופל

הוא יודע לדבר רק באנגלית, כך שלעברית הוא לא רלוונטי בכלל. איכות הפלט תלויה לחלוטין בניסוח של תיאור הקול. אם לא תוסיפו הנחיות כמו סאונד נקי מאוד, אתם עלולים לקבל אודיו עם רעשי רקע מוזרים או אינטונציה מקוטעת. פיסוק משפיע מאוד על זרימת המשפט, ומחייב בדיקה ידנית לפני שמשלבים אותו במערכת אוטומטית.

אותה משפחה

parler-tts-mini יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן על אנגלית בלבד ולא יפיק פלט הגיוני מטקסט בעברית. מי שמחפש פתרון מקומי לשפה העברית יצטרך לבצע אימון מחדש של הארכיטקטורה על דאטה מתאים או לחפש מודל אחר.

איך שומרים על אותו קול בין משפטים שונים?

מציינים את שמו של אחד מ־34 הדוברים המובנים, למשל Jon או Lea, בתוך תיאור הטקסט שמלווה את הבקשה. זה מבטיח שהגוון והסגנון הבסיסי יישארו אחידים בין הפקות שונות.

מה אפשר לעשות אם יש רעש רקע באודיו שנוצר?

המודל מגיב ישירות לטקסט ההנחיה. כדאי להוסיף לתיאור הקול את הביטוי very clear audio כדי לכוון אותו להקלטה נקייה, ולהשתמש בפסיקים בטקסט כדי להסדיר את ההפסקות והקצב.

איך מריצים

המשקלים תופסים כ־3.3 גיגה בייט בדיוק float32, כך שכרטיס מסך ביתי עם 8 עד 12 גיגה זיכרון יריץ אותו בלי בעיה. ההתקנה דורשת משיכה ישירה ממאגר הגיטהאב של הפרויקט ומסתמכת על ספריית transformers. כדי להגיע לביצועים סבירים בזמן אמת, מומלץ להפעיל אופטימיזציות כמו SDPA, קומפילציה בטורץ׳ והזרמת אודיו במקום להמתין לקובץ המלא.

אם אתם צריכים רק שירות הקראה פשוט לאפליקציה פנימית ולא רוצים לתחזק שרת עם GPU, כנראה שעדיף לשלם לפי שימוש ל־API מוכן. המודל הזה משתלם כשרוצים שליטה מלאה על מאפייני האודיו, פרטיות מלאה או כשרוצים לאמן אותו הלאה על דאטה משלכם.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="parler-tts/parler-tts-mini-v1")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי מלא, שינוי הקוד והפצה פנימית או חיצונית. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים ומסמך הרישיון המקורי בתוך המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗