GPT
P

parler-tts-expresso

רץ בדפדפן

parler-ttsרישיון לא דווח2024-05-10

  • gradio

הכלי מייצר דיבור מקבצי טקסט לפי הוראות סגנון מילוליות. הוא מתאים למי שרוצה לבדוק יצירת קול באנגלית עם שליטה ברגש ובאינטונציה.

  • הורדות בחודש
  • 92לייקים

מה זה

אתם מקלידים שני דברים: הטקסט שאתם רוצים להשמיע ותיאור מילולי של הקול. התיאור מגדיר מי מדבר, באיזה קצב, ובאיזה טון, למשל דיבור עם התרגשות והדגשה. הפלט שמתקבל הוא קובץ אודיו לשמיעה ישירות בדפדפן.

מאחורי הקלעים רץ המודל parler-tts-mini-expresso, גרסה קטנה שמבוססת על מאגר הנתונים expresso להבעת רגשות בדיבור. הקוד משתמש במנרמל מספרים באנגלית מבית speecht5 כדי להמיר ספרות למילים כתובות לפני ההקראה, כך שההפקה אמורה להתמודד נכון עם מספרים בתוך המשפט.

בממשק משולבות דוגמאות מובנות עם טקסטים ותיאורי קול מוכנים מראש, שמדגימות את השליטה בסגנון כמו דיבור איטי, מהיר או מודגש. הן מאפשרות לראות מיד אילו ביטויים עובדים טוב עם המודל בלי לנחש ניסוחים.

מתאים ל

  • הדגמת רגשות בדיבור

    בדיקה מהירה של האופן שבו תיאור טקסטואלי משפיע על נימת הדיבור ועל הקצב באנגלית.

  • המרת טקסטים קצרים לאודיו

    הפקת קבצי דיבור לצורך שילוב בסרטונים או במצגות כשרוצים קול ספציפי ולא גנרי.

  • בחינת מודל המיני

    הערכת היכולות של הגרסה המוקטנת לפני שמחליטים להוריד ולהריץ אותה בסביבה מקומית.

איפה זה נופל

הבעיה המיידית היא שהאפליקציה תקועה בשגיאת ריצה ולא עובדת כרגע בדפדפן. מעבר לכך, היא מוגבלת לשפה האנגלית בלבד, בין היתר בגלל רכיב נירמול המספרים שמותאם רק לה, כך שאין מה לנסות להזין עברית. המודל שרץ פה הוא גרסת מיני, ולכן איכות הצליל והדיוק בביצוע הוראות מורכבות נמוכים יותר ממה שמפיקים מודלים מלאים של דיבור.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, הגישה חופשית לגמרי דרך הדפדפן ואין דרישה להכניס כרטיס אשראי או להירשם. עם זאת, כרגע יש בה שגיאת מערכת והיא לא מייצרת קול.

האם אפשר להשתמש בה בעברית?

לא. המודל והקוד כוללים מנרמל מספרים שמיועד לאנגלית בלבד, ואין לו תמיכה בטקסט או בהוראות בעברית.

האם אפשר להריץ את המודל הזה מקומית?

כן, המודל parler-tts-mini-expresso זמין להורדה מקוד פתוח. אפשר לטעון אותו בעזרת ספריית transformers וכרטיס מסך מתאים אצלכם במחשב בלי תלות באתר.

במה שונה האפליקציה הזאת מהמודל הראשי של Parler?

היא משתמשת בגרסת מיני שאומנה על נתוני expresso, שמכוונים לרגשות ולהדגשות בדיבור. זה אומר שיש לה שליטה טובה יותר בניואנסים של טון, אבל איכות הקול הכוללת עשויה להיות פחות יציבה.

איך משתמשים

בממשק מזינים את הטקסט ואת תיאור הקול, או בוחרים דוגמה מוכנה, ולוחצים על Generate Audio. האפליקציה מוגדרת לרוץ על חומרת zero-a10g שמקצה מעבד גרפי לפי דרישה, ללא צורך בהתחברות או תשלום. עם זאת, נכון לעכשיו היא נמצאת במצב של שגיאת ריצה, כך שלחיצה על הכפתור לא תפיק שמע עד שהמפתחים יתקנו את התקלה בעמוד.

הרישיון

הרישיון של היישום לא דווח בקוד או בפרטי העמוד. המשמעות היא שאין הרשאה ברורה לגבי שימוש מסחרי בקבצי הקול שנוצרים או בקוד עצמו. כל עוד הסטטוס המשפטי לא פורסם, לא כדאי להסתמך על התוצרים בפרויקטים מסחריים.

הרישיון המלא ב־Hugging Face ↗