GPT
V

VoiceClone

רץ בדפדפן

fantosרישיון לא דווח2024-08-31

  • gradio

הדגמת רשת להמרת טקסט לדיבור ולשכפול קול מתוך הקלטה קצרה. היא פונה ליוצרי תוכן שרוצים לבדוק את מודל הדיבור הפתוח של OuteAI ישירות בדפדפן.

  • הורדות בחודש
  • 244לייקים

מה זה

אתם מדביקים טקסט של עד 4,096 תווים, בוחרים דובר מובנה או מעלים הקלטה קולית נקייה של 7 עד 10 שניות, ומקבלים קובץ שמע בפורמט WAV. הממשק כולל מחווני טמפרטורה שנעים בין 0.1 ל־1.0 כדי לקבוע עד כמה הדיבור יציב או מגוון, וכן ענישת חזרתיות בין 0.5 ל־2.0 למניעת לולאות פלט.

מאחורי הקלעים הקוד טוען את OuteTTS-0.3-1B באמצעות ספריית outetts עם דיוק bfloat16, ומשתמש ב־Whisper Turbo לתמלול וניתוח השמע שהועלה. רשימת התלויות כוללת מודלי וידאו כבדים כמו OpenSora ו־Latte, אבל הקוד בפועל מפעיל רק את מנוע הדיבור.

מתאים ל

  • קריינות לפודקאסטים ווידאו

    יצירת קטעי דיבור מהירים מטקסט בעזרת קולות מובנים או שכפול עצמי.

  • בדיקת המודל OuteTTS

    התנסות מעשית ביכולות של מנוע הקוד הפתוח לפני שמורידים אותו למחשב.

  • הנגשת טקסטים ארוכים

    המרת מסמכים כתובים לקובצי WAV להאזנה מקומית.

איפה זה נופל

הבעיה המיידית היא שהשרת מושבת ולא מייצר שמע כרגע. מעבר לכך, איכות השכפול תלויה לחלוטין בהקלטה שלכם, ואם יש בה רעשי רקע התוצאה תישמע רע. אין פה כלי עריכה מתקדמים, ולמרות ההבטחה לתמיכה רב-לשונית, איכות ההגייה בשפות כמו עברית דורשת בדיקה זהירה כי מודלים של מיליארד פרמטרים נוטים להתקשות במבטאים שאינם אנגלית.

שאלות
נפוצות

האם השימוש עולה כסף?

לא, הגישה לממשק חופשית לגמרי. אין צורך לשלם מנוי ואין הגבלת כמות רשמית, מעבר למגבלת האורך של 4,096 תווים בכל הרצה.

למה מופיעה שגיאה כשאני מנסה להשתמש בה?

האפליקציה נמצאת כרגע בסטטוס מושהה על ידי מנהלי המרחב. עד שהיא לא תופעל מחדש, השרת של Hugging Face לא מקצה מעבד גרפי והיא לא תגיב.

האם קובצי השמע והקול שלי נשמרים?

הקוד שולח את השמע לניתוח מקומי באמצעות Whisper ומחזיר פלט. עם זאת, אין הצהרת פרטיות רשמית בדף, ולכן עדיף לא להעלות הקלטות רגישות או פרטיות.

אפשר להריץ את זה על המחשב שלי?

כן, המערכת מבוססת על ספריית outetts ומודל OuteTTS-0.3-1B החופשיים. תצטרכו סביבת פייתון עם תמיכה ב־PyTorch וכרטיס מסך מתאים להרצה מהירה.

איך משתמשים

כרגע המרחב נמצא במצב מושהה, כך שאי אפשר פשוט להיכנס ולהריץ אותו בלי להפעיל אותו מחדש. כשהוא פועל על חומרת zero-a10g, כותבים בתיבת הטקסט, מעלים שמע במידת הצורך ולוחצים על כפתור ההפקה. אין צורך בהרשמה או בתשלום, והעיבוד הגרפי מאיץ את יצירת הקובץ, אם כי תחת עומס שרתים ייתכנו תורים.

הרישיון

היוצר לא הגדיר רישיון למרחב. ללא רישיון מפורש, אין אישור רשמי לשימוש מסחרי בקוד או בתוצרים, ולא ידוע מה מדיניות השמירה לגבי דגימות הקול שאתם מעלים לאתר.

הרישיון המלא ב־Hugging Face ↗