GPT
V

vits-models

רץ בדפדפן

zomehwhapache-2.02023-02-08

  • gradio

הדגמה להמרת טקסט לדיבור בסינית וביפנית באמצעות מודלי VITS, המיועדת למי שרוצה לבחון קולות שונים ולייצר קטעי אודיו קצרים ישירות מהדפדפן.

  • הורדות בחודש
  • 805לייקים

מה זה

אתם מדביקים טקסט בתיבה ייעודית, בוחרים שפה מתוך סינית, יפנית או שילוב שלהן, ומקבלים קובץ שמע להאזנה ולהורדה יחד עם הודעת מערכת קצרה. הממשק מציג לשוניות באנגלית ובסינית ומחלק את המודלים לפי קטגוריות ושמות דוברים, כאשר הטקסט כולל דוגמה מוכנה מראש לבדיקה מהירה.

מאחורי הקלעים רץ SynthesizerTrn מתוך ארכיטקטורת VITS ב־PyTorch. הממשק חושף אפשרויות מתקדמות כמו הזנת סמלים פונטיים ישירות, ושלושה סליידרים שמכוונים את התוצאה: noise_scale לרמת הרגש והגיוון, noise_scale_w לאורך הפונמות, ו־length_scale לקביעת מהירות הדיבור הכוללת.

מתאים ל

  • הפקת דיבוב ליפנית וסינית

    יצירת שורות קול קצרות למשחקים או סרטונים עם שליטה מדויקת במהירות ובסמלים.

  • בדיקת מודלי VITS

    השוואה מהירה של הגדרות רעש ואינטונציה על גבי קולות שונים לפני אימון עצמאי.

  • הקראת טקסט מעורב

    השמעת משפטים המשלבים מילים בסינית וביפנית ברצף דיבור אחד באמצעות תגיות.

איפה זה נופל

נכון לעכשיו המרחב נמצא במצב של תקלת ריצה ולא יגיב עד שהיוצר יתקן את הקוד. מעבר לכך, אין כאן תמיכה בעברית או באנגלית והכלי מוגבל אך ורק לסינית וליפנית. יש גם מגבלה קשיחה של 100 מילים בכל הרצה, ושילוב שפות מחייב שימוש בתגיות ידניות כמו [ZH] ו-[JA].

שאלות
נפוצות

האם השירות כרוך בתשלום?

לא, השימוש בעמוד פתוח לחלוטין ואינו דורש תשלום או הרשמה. עם זאת, המרחב כרגע סובל משגיאת ריצה ולא עובד בפועל.

מה קורה עם הטקסט שאני מזין?

הטקסט נשלח למעבד שמריץ את המרחב לצורך יצירת קובץ השמע. אין כאן שמירה של היסטוריה בממשק, אך מדובר בשרת ציבורי ולכן לא כדאי להזין מידע רגיש.

האם אפשר להריץ את זה מקומית על המחשב?

כן, הקוד מבוסס על רישיון apache-2.0 ומשתמש בספריות מוכרות כמו PyTorch ו־Gradio. אפשר להוריד את קובצי הריפו ולהריץ אותם על חומרה מקומית, רצוי עם כרטיס מסך כדי לקבל זמני הפקה סבירים.

האם אפשר להקריא טקסטים ארוכים?

לא, תיבת הקלט כוללת מגבלה מובנית של 100 מילים בכל פעם. טקסטים ארוכים יותר יחייבו חלוקה ידנית של התוכן והרצה בחלקים נפרדים.

איך משתמשים

בוחרים את הדובר בלשוניות, מזינים עד 100 מילים, מכוונים את הסליידרים לפי הצורך ולוחצים על Generate. אין צורך בהרשמה או התחברות כדי להשתמש בממשק.

ההדגמה רצה על מעבד בסיסי בלבד ללא מאיץ גרפי, כך שעיבוד של עשרות מילים לוקח זמן ומורגש היטב, בטח אם יש משתמשים נוספים במקביל.

הרישיון

הקוד מפורסם תחת רישיון apache-2.0 ומאפשר שימוש חופשי ושינוי של המקור. לגבי קובצי הקול שמופקים או הדאטהסטים של הדוברים השונים, תנאי השימוש תלויים במודלים הספציפיים שנטענים ולא מפורטים בממשק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗