GPT
M

moe-tts

רץ בדפדפן

skytntmit2022-08-09

  • gradio

היישום ממיר טקסט לדיבור ומשנה קולות של דמויות אנימה באמצעות מודל VITS ישירות בדפדפן. הוא מיועד למי שרוצה להפיק קטעי אודיו קצרים או להמיר קובץ קול קיים לקולות של דמויות ספציפיות.

  • הורדות בחודש
  • 676לייקים

מה זה

הממשק מחולק לשלוש לשוניות: הקראת טקסט רגילה, המרת קול, והמרת קול מסוג Soft Voice Conversion. בכל לשונית בוחרים מודל מתוך רשימת כרטיסיות. בטקסט מקלידים עד 150 מילים, בוחרים דובר מתוך תפריט, מכוונים את מהירות הדיבור בין 0.5 ל־2 באמצעות סליידר, ומקבלים נגן עם קובץ אודיו מוכן והודעת מערכת. יש גם אפשרות למתקדמים להשתמש ברשימת סמלים ייעודית.

בהמרות הקול מעלים קובץ אודיו באורך של עד 30 שניות. בהמרה הרגילה מגדירים גם את הדובר המקורי וגם את דובר היעד, ובהמרה הרכה בוחרים רק את דובר היעד. מאחורי הקלעים רץ מודל VITS המבוסס על SynthesizerTrn, עם עיבוד ספקטרוגרמות ב־PyTorch וספריית librosa לטעינת האודיו.

מתאים ל

  • הקראת טקסט באנגלית ויפנית

    יצירת קובצי דיבור של דמויות מתוך טקסט קצר עם שליטה בקצב הדיבור.

  • החלפת קול בהקלטה קיימת

    העלאת קובץ שמע של עד חצי דקה והמרת גוון הקול לדמות שנבחרה מראש.

  • בדיקת מודל VITS מקומית

    התנסות ביכולות המודל והשוואה בין המרה רגילה ל־Soft Voice Conversion.

איפה זה נופל

ההגבלות בממשק קשיחות: אי אפשר להזין יותר מ־150 מילים בטקסט, ואי אפשר להעלות קובצי קול שאורכם עולה על 30 שניות. המודלים אומנו על מאגרי קולות וטקסטים של דמויות אנימה, כך שאין כאן תמיכה בעברית או במגוון רחב של שפות וקולות מחוץ לרשימה המובנית.

שאלות
נפוצות

האם השימוש בעמוד עולה כסף?

לא, השימוש בדפדפן פתוח לחלוטין וללא תשלום. אין צורך להכניס אמצעי תשלום ואין צורך לפתוח משתמש כדי להריץ את הדגימות.

כמה זמן לוקח לטקסט להפוך לאודיו?

החומרה של השרת היא מעבד משודרג ללא כרטיס מסך, לכן התהליך אינו מיידי. משפט קצר ייקח בדרך כלל כמה שניות, אך טקסט שמגיע לגבול 150 המילים ייקח יותר זמן.

האם אפשר להריץ את זה על המחשב שלי?

כן, הקוד בנוי בפייתון עם Gradio ומשוחרר ברישיון MIT מלא. אפשר להוריד את הקבצים ולהריץ אותם מקומית עם הספריות הנדרשות כמו PyTorch ו־librosa.

מה קורה לקבצי הקול שאני מעלה להמרה?

הקבצים נשלחים לעיבוד ישירות על גבי השרת שמארח את היישום. הקוד משתמש בתיקיות זמניות של מערכת ההפעלה לצורך העיבוד, אך הם כן עוברים ברשת של Hugging Face.

איך משתמשים

לוחצים על כפתור Generate להפקת דיבור או על Convert להמרת קובץ קול, בלי צורך בחשבון או בהתחברות. היישום רץ על שרת במפרט cpu-upgrade ללא מאיץ גרפי ייעודי, כך שעיבוד של קובצי אודיו או פסקאות ארוכות ידרוש המתנה של מספר שניות עד עשרות שניות, במיוחד אם יש משתמשים נוספים בעמוד.

הרישיון

הקוד פתוח תחת רישיון MIT, שמאפשר שימוש חופשי, שינוי והפצה. קובצי הקול שאתם מעלים והאודיו שנוצר מעובדים בשרת של Hugging Face, ואין בתיעוד פירוט לגבי שמירה או מחיקה שלהם מעבר לקוד שמשתמש בספריות זמניות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗