GPT
F

kevinwang676/F5-TTS

רץ בדפדפן

kevinwang676רישיון לא דווח2025-04-06

  • gradio

שכפול קול מאודיו קצר והקראת טקסטים בלי צורך באימון מראש. מתאים למי שרוצה לבדוק דיבוב מותאם אישית או שיחה קולית מול מודל שפה.

  • הורדות בחודש
  • 91לייקים

מה זה

מעלים קובץ שמע של קול קיים, מקלידים טקסט, ומקבלים קובץ אודיו חדש שנשמע כמו הדובר המקורי יחד עם תמונת ספקטרוגרמה של התוצאה. הממשק מחולק לשלושה אזורים עיקריים, שכוללים הקראה של קטעי טקסט ארוכים, הפקת דיבור משולב בכמה סגנונות וסוגי רגש על בסיס דגימות שונות, וממשק צ'אט קולי שמשלב שיחה ישירה עם מיקרופון.

מאחורי הקלעים רצים מודלי הדיבור F5-TTS ו־E2-TTS שנשענים על ארכיטקטורות DiT ו־UNetT, ואומנו על מאגרי הנתונים Emilia-Dataset ו־seed_tts. לשחזור גל הקול נעשה שימוש במקודדים Vocos או BigVGAN, לתמלול משמש Whisper-large-v3-turbo, ובאזור השיחה משולבים מודלי שפה כמו Qwen2.5-3B-Instruct או Phi-4-mini-instruct.

מתאים ל

  • הקראת טקסט בקול מותאם

    מעלים דגימת קול אחת ומפיקים ממנה קובץ דיבור חדש של פסקאות שלמות.

  • יצירת דיאלוג רב סגנונות

    מגדירים סוגי דיבור שונים עם שמע נפרד ומשלבים תגיות בטקסט לקבלת מעברים בין סגנונות.

  • שיחה קולית עם מודל שפה

    מדברים למיקרופון מול Qwen או Phi ומקבלים תשובות קוליות בקול המוגדר מראש.

איפה זה נופל

ההדגמה לא עובדת כרגע בגלל תקלת ריצה, כך שאי אפשר להפיק ממנה אודיו בלי לפתור את השגיאה בקוד או להעתיק את הקוד אליכם. הממשק מוגבל במספר סגנונות הדיבור שניתן להוסיף ברצף אחד ומציג אזהרה כשעוברים את המכסה. בנוסף, מודלי השפה בצ'אט דורשים טעינה נפרדת לזיכרון ועלולים לקרוס תחת עומס הזיכרון של כרטיס ה־A10G.

שאלות
נפוצות

האם השימוש בהדגמה עולה כסף?

הגישה למרחב עצמו בחינם לחלוטין ואין צורך בתשלום כדי לפתוח אותו. המשאבים ממומנים על גבי תשתית הענן של הפלטפורמה. עם זאת, נכון לעכשיו המרחב מדווח על תקלת הרצה ולא מפיק תוצאות בפועל.

מה קורה עם קבצי הקול שאני מעלה?

הקבצים נשלחים לעיבוד במעבד הגרפי שמריץ את המרחב ונשמרים בתיקיות זמניות בשרת. מכיוון שמדובר בהדגמה ציבורית ללא רישיון מוגדר, מומלץ לא להעלות הקלטות פרטיות או רגישות.

כמה זמן לוקח לייצר קטע קול?

במצב תקין, החומרה המוגדרת היא כרטיס A10G שמספק מהירות עיבוד טובה של שניות בודדות למשפט. זמן ההמתנה מושפע גם מכמות הצעדים שבחרתם בסליידר ה־nfe ומאורך הטקסט. כרגע המערכת תקועה ולא תבצע את החישוב.

האם אפשר להריץ את זה על המחשב שלי?

כן, הקוד הציבורי נשען על חבילת הפייתון של f5-tts ומודלים פתוחים שניתן להוריד. תצטרכו כרטיס מסך של Nvidia עם זיכרון מספק כדי להריץ את מודל הדיבור ומודל השפה. ההרצה המקומית עוקפת את שגיאת הריצה שיש כרגע בעמוד.

במה הממשק הזה שונה מהמודל המקורי?

הדף הזה הוא הדגמה לא רשמית שחיבר המשתמש kevinwang676 על גבי המודלים המקוריים של SWivid. הוא הוסיף עטיפה גרפית שמאפשרת שילוב סגנונות וחיבור למודלי שפה חיצוניים כמו Phi ו־Qwen בתוך מסך אחד.

איך משתמשים

טוענים קובץ שמע של הדובר להגדרה, מזינים את הטקסט שלו, כותבים את הטקסט החדש שרוצים להקריא ולוחצים על כפתור ההפקה. בהגדרות המתקדמות אפשר לשלוט על מהירות ההקראה, הסרת שתיקות, ומספר צעדי הדגימה nfe. המערכת מוגדרת על חומרת zero-a10g שמספקת כרטיס גרפי לפי דרישה, אבל כרגע היא במצב של שגיאת ריצה ולכן אי אפשר להריץ אותה ישירות בדפדפן בלי תיקון.

הרישיון

הרישיון של המרחב לא דווח על ידי היוצר. לא ברור אם מותר להשתמש בתוצרים לצרכים מסחריים, וכל קובץ שמע וטקסט שמעלים לממשק מועבר דרך השרתים הציבוריים של Hugging Face.

הרישיון המלא ב־Hugging Face ↗