GPT
V

Voice-Cloning-XTTS-v2

רץ בדפדפן

hasanbasbunarother2025-04-12

  • gradio

הכלי מייצר הקראת טקסט בקול משוכפל לפי קובץ שמע שאתם מספקים או בוחרים מרשימה. הוא מיועד למי שרוצה לבדוק דיבוב קולי בלי להרים שרת עצמאי.

  • הורדות בחודש
  • 94לייקים

מה זה

אתם מספקים טקסט להקראה ודוגמת קול, שיכולה להגיע מקישור ישיר לקובץ או מתוך רשימת דוגמאות מובנית במערכת. בתמורה מקבלים קובץ שמע שבו הטקסט מוקרא בגוון הקול שנבחר.

מאחורי הקלעים רץ המודל XTTS-v2 של חברת Coqui. הקוד כולל מנגנון שבודק ומנקה את הטקסט לפני השיגור, ומזהיר מפני קישורים, כתובות אימייל, אימוג'ים, מספרים ארוכים, ראשי תיבות וסימני פיסוק מרובים שעלולים לשבש את ההגייה.

בנוסף מתבצעת חלוקה של הטקסט למקטעים לפי שקט או כמות תווים, עם אפשרות לשלוט בפרמטרים כמו מהירות הדיבור, טמפרטורה, וזיהוי שקט בהקלטה.

מתאים ל

  • בדיקת איכות שכפול קול

    ניסוי מהיר של מודל XTTS-v2 על טקסטים מותאמים אישית מול דוגמאות שמע קיימות.

  • הפקת שמע מקבצי קישור

    יצירת קטעי דיבור מבוססי קול חיצוני על ידי הזנת כתובת URL של קובץ מקור.

  • הקראת טקסט נקי

    זיהוי וסינון מוקדם של אימוג'ים וסימנים מיוחדים שמשבשים מנועי הקראה.

איפה זה נופל

אם הטקסט כולל מספרים ארוכים, ספרות רומיות או כתובות אינטרנט, המערכת תסמן אותם כבעיה שעלולה להוביל להגייה משובשת. בנוסף, חובה להזין קישור ישיר לקובץ שמע חיצוני או לבחור מהדוגמאות, ואי אפשר להעלות קובץ ישירות מהמחשב דרך השדות שנבדקו. יש גם הגבלה על שפות נתמכות, והזנת שפה שאינה ברשימה תעצור את התהליך עם שגיאה.

שאלות
נפוצות

האם השימוש בעמוד כרוך בתשלום?

האפליקציה פתוחה לשימוש חופשי בדפדפן על גבי התשתית של Hugging Face. אין צורך בהזנת אמצעי תשלום כדי להריץ אותה. עם זאת, הזמינות תלויה במכסות השרת השיתופי.

כמה זמן לוקח לייצר קובץ שמע?

זמן היצירה תלוי באורך הטקסט שהזנתם ובמצב התור של מאיץ ה־A10G. בדרך כלל מדובר בכמה שניות עד חצי דקה למקטע קצר. אם השרת היה כבוי, תיתכן המתנה ראשונית להקצאת המשאבים.

במה היישום הזה שונה משימוש ישיר במודל?

הוא חוסך את הצורך לכתוב קוד פייתון ולהחזיק כרטיס מסך מתאים. בנוסף, יש בו שכבת בדיקה שמנתחת את הטקסט ומזהירה מטעויות הגייה נפוצות. מצד שני, אתם מוגבלים לפרמטרים ולמבנה שהוגדרו מראש בממשק.

מה קורה עם קובצי השמע והטקסט שמזינים לשם?

העיבוד נעשה על גבי השרת שמריץ את המרחב הציבורי. הקוד מוריד את קובצי הייחוס למחיצות זמניות לצורך החישוב. לא כדאי להזין לשם טקסטים סודיים או הקלטות רגישות שאינכם רוצים לחשוף ברשת.

איך משתמשים

הממשק בנוי בגרדיו ומאפשר לבחור דוגמת קול או להדביק כתובת לקובץ חיצוני, להזין טקסט, לכוונן את הגדרות המודל וללחוץ על הפעלה. אי אפשר להזין גם קישור וגם לבחור דוגמה מוכנה יחד.

העיבוד רץ על מאיץ A10G דרך מנגנון Zero-GPU, כך שהמשאבים מוקצים לפי דרישה. ייתכן זמן המתנה קצר אם השרת נמצא בעומס או נטען מחדש.

הרישיון

הרישיון מוגדר בתור other. מודל הבסיס XTTS-v2 פותח במקור על ידי Coqui תחת תנאי שימוש משלו, ולכן אסור להניח שמותר להשתמש בתוצרים לצרכים מסחריים בלי לבדוק את תנאי המודל המקוריים.

הרישיון המלא ב־Hugging Face ↗