GPT
I

indic-parler-tts — הדגמה

קוד פתוח

ai4bharatapache-2.02024-12-03

  • gradio

הופך טקסט מבוסס שפות הודיות לדיבור לפי הנחיות סגנון מילוליות. מתאים למי שבוחן מודלי שמע פתוחים ומחפש שליטה בקול ובאיכות ההקלטה.

  • 938Mפרמטרים
  • 3.5 GBמשקל הקבצים
  • הורדות בחודש
  • 196לייקים

מה זה

אתם מקלידים שני דברים: את הטקסט שאתם רוצים להשמיע, ותיאור מילולי חופשי באנגלית שמגדיר את אופי הדיבור, כמו מגדר הדובר, קצב הדיבור או רמת רעשי הרקע. בתגובה מקבלים נגן עם קובץ שמע בפורמט mp3 שמתנגן מיד.

מאחורי הקלעים רצים שני מודלים לבחירה בלשוניות נפרדות, גרסה מאומנת וגרסת בסיס מקדימה של Parler-TTS, יחד עם flan-t5-large של גוגל שמעבד את תיאור הקול. המערכת כוללת דוגמאות מובנות שמציגות משפטי טקסט מוכנים יחד עם תיאורי קול מתאימים, כך שלא חייבים להמציא ניסוחים מאפס.

מתאים ל

  • בדיקת איכות קול

    השוואה מהירה בין ביצועי מודל הבסיס לגרסה המאומנת עבור הפקת דיבור.

  • שליטה בסגנון דיבור

    בדיקת היכולת להגדיר קצב, מגדר ואיכות הקלטה באמצעות הנחיה טקסטואלית בלבד.

  • הפקת שמע לשפות הודיות

    יצירת קובצי mp3 מתוך טקסט כתוב בשפות נתמכות ישירות מהדפדפן.

איפה זה נופל

הכלי מיועד לשפות הודיות ולא תומך בעברית. הדוגמאות המוכנות מראש לא נשמרות במטמון אלא מחושבות בזמן אמת, כך שכל בדיקה דורשת חישוב מחדש. בנוסף, רמת הדיוק של הטונציה תלויה לחלוטין בניסוח תיאור הקול, ואם לא מדייקים בהוראות, התוצאה עשויה להישמע לא טבעית.

שאלות
נפוצות

האם השימוש בהדגמה עולה כסף?

לא, הממשק פתוח לשימוש חופשי בדפדפן. אין צורך להזין אמצעי תשלום ואין מגבלת מנוי.

האם הכלי עובד עם טקסט בעברית?

לא, המודלים נבנו ואומנו ספציפית עבור שפות הודיות. הזנת עברית לא תניב פלט תקין.

במה שונה גרסת Finetuned מגרסת Pretrained בממשק?

גרסת Finetuned עברה התאמה נוספת על נתונים ספציפיים כדי לשפר את איכות הדיבור. גרסת Pretrained מייצגת את מודל הבסיס הראשוני, ושתי הלשוניות מאפשרות להשוות את התוצאות ביניהן.

האם אפשר להריץ את זה באופן מקומי?

כן, המודלים והספריות פתוחים ברישיון apache-2.0 וזמינים להורדה. אפשר למשוך את המשקלים של ai4bharat ולהריץ אותם על חומרה תואמת עם PyTorch.

איך מריצים

בוחרים לשונית בין הדגם המאומן לדגם הבסיס, מזינים טקסט ותיאור או לוחצים על אחת הדוגמאות, ומקליקים על Generate Audio. הריצה מתבצעת על מאיץ גרפי מסוג zero-a10g, כך שהעיבוד מתחיל תוך שניות בודדות בלי צורך בהתקנה, התחברות או תשלום. אין צורך לחכות לאישור ידני, אבל העומס ברשת עשוי להשפיע על זמן ההמתנה.

pip install -U huggingface_hub
hf download ai4bharat/indic-parler-tts

הרישיון

הקוד והמודלים מופצים ברישיון apache-2.0, שמתיר שימוש מסחרי, שינוי והפצה של הקוד. הטקסטים והתיאורים שאתם מזינים נשלחים ישירות לשרת שמריץ את ההדגמה ומייצר את קובץ השמע.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗