GPT
P

parler_tts

רץ בדפדפן

parler-ttsapache-2.02024-04-09

  • gradio

הופך טקסט מוקלד לקובץ שמע לפי תיאור מילולי של הקול. מיועד למי שרוצה לבדוק יצירת דיבור מלאכותי באנגלית בלי להוריד מודלים למחשב.

  • הורדות בחודש
  • 848לייקים

מה זה

אתם כותבים טקסט ומגדירים באנגלית איך הקול צריך להישמע, למשל קצב הדיבור, איכות ההקלטה ורעשי הרקע. יש שם 34 דוברים מוגדרים מראש שאפשר לציין בשמם, כמו מייק או ג'ון, לצד מאפיינים כמו טון מונוטוני או מלא חיים. התוצאה שמתקבלת בחלון היא נגן שמע שמשמיע את ההקלטה שנוצרה.

מאחורי הקלעים רץ הקוד של parler_tts בשתי גרסאות, mini מול large. הקוד משתמש במנרמל מספרים שמיועד ספציפית לאנגלית, כך שכל הניתוח בנוי על השפה הזו ולא מתאים לעברית. הדוגמאות בעמוד מראות איך לתאר את הקול בצורה ישירה כדי לשלוט בתוצאה, במקום לבחור שמות מתוך תפריט יבש.

מתאים ל

  • בדיקת איכות דיבור באנגלית

    מזינים משפטים קצרים ובודקים איך המודל הוגה אותם בקולות שונים לפני שמורידים את המשקלים.

  • יצירת שמע לפי סגנון מוגדר

    מגדירים תיאור כמו קול מהיר או הקלטה נקייה מרעשים ומפיקים קובץ דיבור מותאם.

  • השוואה בין שני המודלים

    מסמנים את תיבת המודל הגדול כדי לשמוע אם איכות הקול שווה את זמן ההמתנה הנוסף.

איפה זה נופל

הכלי מוגבל לאנגלית בלבד בגלל חלקי הקוד שמטפלים בשפה, כך שאי אפשר להקליד בו עברית ולקבל תוצאה סבירה. התיאור המילולי נותן חופש אבל לא תמיד מדייק בכל הברה, והמעבר למודל הגדול גובה מחיר כבד במהירות התגובה בדפדפן. לפני שרצים להשתמש בזה לפרויקטים אמיתיים, כדאי לשים לב שזמני ההמתנה ברשת לא מתאימים לתהליכים שדורשים שמע מיידי.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, הגישה בדפדפן פתוחה לגמרי ללא תשלום. אין צורך להכניס כרטיס אשראי או לרכוש מנוי כדי להריץ את הבדיקות.

האם אפשר להריץ את המערכת הזו מקומית?

כן, המודלים parler-tts-mini-v1 ו־large פתוחים להורדה תחת רישיון apache-2.0. אפשר להתקין את ספריית parler_tts ולהריץ אותם על מחשב עם חומרה מתאימה.

האם האפליקציה תומכת בהקראת טקסט בעברית?

לא, המודלים והקוד משתמשים בנרמול טקסט באנגלית ובשמות דוברים באנגלית בלבד. טקסט בעברית לא יעבוד פה.

כמה זמן לוקח לייצר שמע?

הריצה מבוססת על כרטיס A10G שמוקצה לפי דרישה. מודל ה־mini מייצר שמע תוך שניות בודדות, אך אם בוחרים באפשרות של המודל הגדול הפעולה איטית משמעותית.

איך משתמשים

מקלידים את הטקסט, ממלאים את תיאור הקול ולוחצים על כפתור הייצור. יש תיבת סימון שמאפשרת לבחור במודל הגדול, והממשק עצמו מציין מראש שהוא מייצר אודיו טוב יותר אבל איטי בהרבה. השרת מקצה מעבד גרפי מדגם zero-a10g בזמן הריצה, כך שאין צורך בהתקנה, אבל עלולים להמתין אם השרת עמוס באותו רגע.

הרישיון

הקוד והמודלים משוחררים תחת רישיון apache-2.0, שמאפשר שימוש חופשי ופיתוח מסחרי לפי תנאי הרישיון. הטקסט שאתם מזינים עובר ישירות לעיבוד בשרת הרץ, וקובץ השמע נוצר בדפדפן שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗