GPT
E

E2-F5-TTS

רץ בדפדפן

mrfakenameרישיון לא דווח2024-03-08

  • gradio

העמוד הזה משכפל קולות של אנשים לפי דגימת אודיו קצרה ומקריא טקסט חדש. הוא מיועד למי שרוצה לבדוק דיבוב מותאם אישית בלי לאמן מודל מאפס.

  • הורדות בחודש
  • 2,899לייקים

מה זה

אתם מעלים קובץ שמע קצר עם הקול שרוצים לשכפל, ומקלידים בתיבה הראשונה בדיוק את מה שנאמר בהקלטה. בתיבה השנייה כותבים את המשפט החדש שרוצים להפיק, ויש גם אפשרות לסמן תיבה שמסירה שתיקות מיותרות מהתוצאה הסופית. בתמורה מקבלים קובץ אודיו שבו אותו קול מקריא את הטקסט החדש.

מאחורי הקלעים רץ המודל F5-TTS יחד עם E2-TTS של SWivid, לצד מודלים כמו whisper-large-v3-turbo לתמלול ורכיבי vocos או BigVGAN להפקת גלי הקול. המערכת נשענת על נתונים ממאגרים כמו Emilia-Dataset ו־seed_tts, שנועדו ליצירת דיבור טבעי בגישת Zero-Shot, כלומר חיקוי ישיר של דגימה בודדת ללא שלב התאמה מוקדם.

מתאים ל

  • בדיקת שכפול קול מהירה

    העלאת הקלטה קצרה כדי לבדוק איך מודל F5-TTS מתמודד עם גוון קול מסוים.

  • יצירת קריינות מותאמת

    הפקת משפטי דיבור חדשים עבור סרטונים או פודקאסטים מתוך דגימת מקור קיימת.

  • הסרת שתיקות מדיבוב

    יצירת קובץ דיבור נקי מרעשי רקע והפסקות ארוכות בעזרת תיבת הסימון המובנית.

איפה זה נופל

ההדגמה הזו דורשת מכם לתמלל ידנית ובמדויק את מה שנאמר בהקלטת המקור כדי לקבל תוצאה סבירה. אם הטקסט לא תואם בדיוק את האודיו, השכפול נוטה להישבר או להישמע מתכתי ומקוטע. בנוסף, הקוד מציג ממשק מצומצם מאוד שלא חושף הגדרות מתקדמות של המודלים המקוריים, ולא ידוע אם הוא כולל תמיכה תקינה בעברית מעבר לדוגמאות הטקסט באנגלית שמופיעות בממשק.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, השימוש בעמוד פתוח לכולם ללא תשלום. אין צורך להזין אמצעי תשלום, אך הגישה תלויה בזמינות השרתים השיתופיים.

מה קורה עם קובצי הקול שאני מעלה?

הקבצים מעובדים בשרת שמריץ את הממשק לצורך יצירת הדיבור החדש. מכיוון שלא פורסמה מדיניות פרטיות או רישיון, לא כדאי להעלות הקלטות רגישות או מידע אישי.

כמה זמן לוקח לייצר קטע שמע?

התהליך לוקח בדרך כלל כמה שניות עד חצי דקה, בהתאם לאורך הטקסט. השרת משתמש במאיץ מסוג A10G, אבל בזמני עומס ייתכן שתמתינו בתור.

במה העמוד שונה מהרצת המודל עצמו?

כאן מדובר בהדגמה לא רשמית עם ממשק פשוט שלא כולל את כל כלי השליטה של הקוד המקורי. מי שמתקין את F5-TTS מקומית מקבל שליטה מלאה על הפרמטרים בלי תלות ברשת.

איך משתמשים

מזינים קובץ שמע לתוך תיבת ה־Reference Audio, ממלאים את שני שדות הטקסט של הדיבור הקיים והדיבור המבוקש, ולוחצים על כפתור ההפעלה בתחתית. הממשק רץ על חומרת zero-a10g שמקצה מעבד גרפי לפי דרישה. העיבוד עצמו מתבצע ישירות בדפדפן בלי צורך בהתקנה, אבל מכיוון שמדובר במשאב שיתופי ברשת, ייתכן שתמתינו בתור קצר אם יש עומס של משתמשים אחרים באותו רגע.

הרישיון

הרישיון של המרחב הזה לא דווח על ידי היוצר. המשמעות היא שאין הרשאה ברורה ומפורשת לשימוש מסחרי בתוצרים או בקוד ישירות מכאן, ומומלץ לבדוק את תנאי הרישיון של המודלים המקוריים F5-TTS ו־E2-TTS לפני שמפיצים קבצים שנוצרו דרכו.

הרישיון המלא ב־Hugging Face ↗