GPT
P

parler-tts-large-v1

קוד פתוח

parler-ttsapache-2.02024-08-08

  • transformers
  • safetensors
  • parler_tts
  • text-generation
  • text-to-speech

הפקת דיבור בקוד פתוח עם שליטה מלאה בטון דרך טקסט חופשי. מתאים למי שרוצה קול ייחודי משלו בלי להסתמך על שירותי ענן סגורים.

  • 2.3Bפרמטרים
  • 8.7 GBמשקל הקבצים
  • 11,634הורדות בחודש
  • 275לייקים

מה זה

במקום לשחק עם מזהי קול מספריים, מתארים במילים בדיוק איך הקריין צריך להישמע. כותבים אם רוצים קול מהיר, צרוד, עם הד או בלי רעשי רקע, והתוצאה נוצרת לפי התיאור. המודל אומן על 45 אלף שעות אודיו באנגלית, ומכיל 34 דוברים קבועים עם שמות שאפשר לבקש ישירות כדי לשמור על עקביות בין משפטים שונים.

ההבדל העיקרי מול מודלים קלים יותר הוא הנפח והדיוק של השליטה. המפתחים שחררו לא רק את המשקולות אלא גם את קוד האימון ועיבוד המידע. זה מאפשר לקחת את הבסיס הזה ולאמן אותו הלאה, במקום להישאר תלויים בתוצאות המקוריות בלבד.

מתאים ל

  • הקראת פודקאסטים וספרים באנגלית

    34 הדוברים הקבועים מאפשרים לשמור על אופי קולי אחיד לאורך פרקים שלמים.

  • יצירת דמויות למשחקים

    אפשר לבקש קול צרוד, מבוגר או מלא בהד ישירות מתוך שורת פרומפט פשוטה.

  • קריינות למערכות פנימיות

    עובד כולו מקומית בלי תלות ברשת חיצונית ובלי לשלוח טקסטים לשרתי צד שלישי.

איפה זה נופל

המודל תומך באנגלית בלבד, כך שלעברית הוא פשוט לא רלוונטי כרגע בלי אימון מחדש. שליטה מלאה בפרוזודיה דורשת ניסוי וטעייה עם סימני פיסוק, וההבדלים בין תיאור טקסטואלי אחד לאחר יכולים להיות רגישים מאוד. בנוסף, מי שבוחר דובר אקראי עלול לקבל חוסר עקביות בין קטעים שונים באותו רצף.

שאלות
נפוצות

האם הוא מסוגל להקריא טקסט בעברית?

לא. המודל אומן על אנגלית בלבד, ואין לו תמיכה מובנית בשפות אחרות.

איך גורמים לקול להישמע נקי מרעשים?

מוסיפים לפרומפט התיאור את הביטוי very clear audio. המודל מגיב ישירות למילים שמתארות את איכות ההקלטה.

איך שומרים על אותו קול בכמה בקשות שונות?

מציינים בתיאור שם של אחד מ־34 הדוברים המובנים, כמו Jon או Laura, יחד עם שאר מאפייני הדיבור.

איך מריצים

המשקל הכולל מגיע ל־8.7 גיגה בייט בדיוק float32, כך שחייבים כרטיס מסך עם זיכרון ייעודי סביר כדי לייצר אודיו בקצב נורמלי. המפתחים ממליצים להפעיל מנגנונים כמו SDPA, קומפילציה ב־PyTorch והזרמת אודיו כדי לקצר זמני תגובה. ההתקנה עצמה מתבצעת ישירות ממאגר הגיטהאב של הפרויקט עם pip ומבוססת על transformers.

אם אתם צריכים רק הקראה בסיסית ואין לכם שרת ייעודי, גרסת המיני של אותו פרויקט תהיה חסכונית בהרבה במשאבים. להרצה מקומית של הגרסה הזו נכנסים רק כשחייבים את מגוון השליטה הקולי או את השמות הספציפיים שהוטמעו בה.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="parler-tts/parler-tts-large-v1")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש. אין דרישה לפתוח את הקוד שלכם, וכל עוד מצרפים את הרישיון המקורי והודעת זכויות יוצרים, מותר לשלב אותו במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗