GPT
S

Soprano-TTS

רץ בדפדפן

ekwekapache-2.02025-12-22

  • gradio
  • mcp-server

ממירים טקסט ישירות לקובץ שמע דרך הדפדפן. הממשק מתאים למי שרוצה לבדוק דיבוב קולי אוטומטי בלי להתקין ספריות מקומיות.

  • הורדות בחודש
  • 151לייקים

מה זה

אתם מקלידים טקסט לתוך תיבת הטקסט בממשק, לוחצים על הכפתור ומקבלים נגן עם קובץ שמע מוכן להאזנה ולהורדה. מתחת למכסה המנוע רץ המודל Soprano-1.1-80M באמצעות הספרייה soprano וסביבת torch, שמייצרת את גלי הקול מתוך הטקסט המוזן.

לצד ההזנה הרגילה יש תפריט הגדרות מתקדמות עם פרמטרים כמו temperature, top_p ו־repetition_penalty, שמשפיעים על אופי הדיבור וההיצמדות לטקסט. הממשק מציג גם דוגמאות מובנות מראש שמאפשרות ללחוץ ולשמוע איך המודל מתמודד עם משפטים שונים בלי צורך להקליד בעצמכם.

מתאים ל

  • בדיקת מודל קל

    הערכת איכות ההקראה של מודל 80M לפני שמורידים ומריצים אותו מקומית.

  • הפקת סאונד לבדיקות

    יצירת קובצי שמע מהירים לבדיקת ממשקים ומערכות שדורשות פלט קולי.

  • הקראת טקסטים קצרים

    המרת פסקאות קצרות לקול בלי לפתוח סביבת פיתוח או להגדיר שרת.

איפה זה נופל

המודל שרץ כאן הוא בנפח של 80 מיליון פרמטרים, שזה מודל קטן למדי ביחס למערכות דיבוב כבדות, ולכן הוא עלול להישמע רובוטי או לטעות בהגייה מורכבת. אין כאן אפשרויות לשיבוט קול, שליטה ברגשות או בחירת דוברים שונים מתוך רשימה. בנוסף, חומרת שיתוף עלולה להכניס אתכם להמתנה כשיש עומס משתמשים.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, הגישה בדפדפן פתוחה לגמרי ללא תשלום. אין צורך להזין אמצעי תשלום או לפתוח חשבון כדי לנסות אותה. כל עוד השרת זמין, אפשר להשתמש בה בחופשיות.

כמה זמן לוקח לייצר קובץ שמע?

העיבוד עצמו מתבצע על מאיץ A10G וגוזל שניות ספורות בלבד עבור משפטים קצרים. יחד עם זאת, במקרים של עומס או כשהחומרה מתעוררת ממצב שינה, ייתכן עיכוב של כמה שניות נוספות לפני תחילת העבודה.

האם אפשר להריץ את המערכת הזאת על המחשב שלי?

כן, הקוד מבוסס על ספריית soprano ומודל Soprano-1.1-80M הפתוחים לציבור. מאחר שמדובר במודל של 80 מיליון פרמטרים, אפשר להריץ אותו מקומית גם על חומרה צנועה יחסית.

מה קורה עם הטקסט שמקלידים בממשק?

הטקסט נשלח לשרת שמארח את האפליקציה כדי לייצר את גלי הקול. הממשק לא דורש הרשמה, אך הטקסט עובר עיבוד בענן ולכן לא כדאי להזין בו מידע סודי או פרטי.

איך משתמשים

מקלידים את המשפט הרצוי בתיבה או בוחרים דוגמה מוכנה, ואם רוצים פותחים את ההגדרות המתקדמות כדי לכוונן ערכים. לחיצה על Generate Speech מפעילה את העיבוד. האפליקציה רצה על חומרת zero-a10g שמקצה מעבד גרפי לפי דרישה, כך שזמן ההמתנה תלוי בעומס ובזמן ההקצאה, בלי צורך בחשבון או בהתחברות כדי להתחיל.

הרישיון

הפרויקט מפורסם תחת רישיון apache-2.0, שמאפשר שימוש חופשי וגם מסחרי בקוד ובמודל בכפוף לתנאי הרישיון. התוכן שאתם מעלים מועבר לשרת לצורך יצירת הדיבור, וכדאי לקחת זאת בחשבון אם מדובר בטקסט רגיש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗