GPT
P

parler_tts_mini_v0.1

קוד פתוח

parler-ttsapache-2.02024-04-09

  • transformers
  • safetensors
  • parler_tts
  • text-generation
  • text-to-speech

מודל פתוח להמרת טקסט לדיבור באנגלית שמאפשר לשלוט באופי הקול, בקצב וברעשי הרקע בעזרת תיאור טקסטואלי חופשי, בלי להסתמך על דוגמאות קול מוקלטות מראש.

  • 647Mפרמטרים
  • 2.4 GBמשקל הקבצים
  • 2,743הורדות בחודש
  • 358לייקים

מה זה

במקום לתת למודל קובץ אודיו ולבקש ממנו לחקות אותו, כאן מתארים במילים איך הקול צריך להישמע. כותבים לו אם רוצים גבר או אישה, קצב דיבור מהיר, גובה צליל מסוים, הדהוד, או אפילו אם להוסיף רעשי רקע ולהקליט באיכות נמוכה. המודל אומן על 10,500 שעות של אודיו ויושב על ארכיטקטורה של 647 מיליון פרמטרים.

הפרויקט הזה מבוסס על מחקר של Stability AI ואוניברסיטת אדינבורו, אבל בניגוד לפתרונות סגורים, כל הקוד והמשקלים כאן פתוחים לגמרי. הוא מיועד למי שרוצה שליטה מדויקת באווירה של הדיבור ישירות מתוך הפרומפט, בלי להתעסק עם מזהי דוברים מקובעים מראש.

מתאים ל

  • הקראת פודקאסטים וסיפורים

    אפשר לייצר דמויות שונות באנגלית על ידי שינוי פשוט של תיאור הקול והטון בכל קטע טקסט.

  • סימולציה של שיחות רדיו

    היכולת להכניס רעשי רקע והדהוד דרך הפרומפט מתאימה מאוד להפקת קולות קשר או תקשורת רקע למשחקים.

  • אימון מודל קולי מותאם אישית

    הקוד פתוח לחלוטין וכולל מדריכי התאמה, מה שמאפשר לאמן אותו על דובר יחיד לפי הצורך.

איפה זה נופל

הבעיה המרכזית עבור קהל מקומי היא השפה, המודל אומן ויודע לדבר אך ורק באנגלית. הוא לא תומך בעברית, ולפי התיעוד אין לו שום הבנה של שפות אחרות כרגע.

בנוסף, מדובר בגרסת v0.1 ראשונית מאוד. איכות האודיו תלויה לחלוטין בניסוח הפרומפט, ואם תשכחו להגדיר לו סביבה נקייה תקבלו לפעמים הקלטה שנשמעת מוזרה ומלאה ברעשים. פיסוק הטקסט משפיע ישירות על זרימת הדיבור, כך שפסיק חסר יכול לקלקל את כל המשפט.

אותה משפחה

parler-tts-mini יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן על אנגלית בלבד ולא יודע לקרוא או להגות טקסט בעברית.

איך דואגים שהקול יישמע נקי ולא חורק?

התיעוד ממליץ להוסיף במפורש את המילים very clear audio בתיאור הטקסטואלי כדי לקבל תוצאה צלולה, ולהשתמש בפסיקים כדי ליצור הפסקות טבעיות במשפט.

איך מריצים

המודל שוקל 2.4 גיגה בייט בדיוק של float32, כך שהוא לא דורש מפלצת חומרה כדי לרוץ. כל כרטיס מסך ביתי מודרני עם שמונה גיגה זיכרון יחזיק אותו בלי בעיה לצורך הסקת מסקנות, וגם מעבד סביר יצליח להתמודד איתו אם לא לחוצים על זמן אמת.

כדי להשתמש בו צריך להתקין את הספרייה הייעודית של הפרויקט מגיטהאב, והוא נתמך ישירות דרך transformers. אם אתם צריכים מענה מהיר של מילישניות במוצר חי, כדאי לבדוק קודם את הביצועים המקומיים מול שירותי ענן מסחריים, אבל לפיתוח מקומי או לעיבוד אופליין קל מאוד להרים אותו לבד.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="parler-tts/parler_tts_mini_v0.1")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר לקחת את המשקלים, להטמיע אותם במוצר מסחרי סגור, לשנות את הקוד ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים של המפתחים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗