GPT
B

Bark-with-Voice-Cloning

רץ בדפדפן

kevinwang676mit2023-04-27

  • gradio

הכלי מציע שכפול קולות והפקת דיבור מטקסט על בסיס מודלים של Bark. הוא מיועד למי שרוצה לבדוק התאמה אישית של דיבור בלי להתקין סביבת פיתוח שלמה במחשב.

  • הורדות בחודש
  • 333לייקים

מה זה

הממשק מחולק לשני חלקים מרכזיים, שכפול קול ויצירת דיבור. בחלק הראשון מעלים קובץ שמע בפורמט wav, והמערכת מחלצת ממנו מאפיינים ויוצרת קובץ הגדרות קול בסיומת npz. בחלק השני מקלידים טקסט, בוחרים דובר מתוך רשימה מובנית או מפנים לקובץ שנוצר, ויוצרים קטע שמע חדש לפי הטקסט שהוזן.

מתחת למכסה המנוע רץ המודל suno/bark לצד הרחבות שכפול קול מבוססות HuBERT, כולל גרסאות ייעודיות לגרמנית ולפולנית, וכן המודל הרב-לשוני bert-base-multilingual-cased. הקוד כולל פונקציות לשיפור שמע, חלוקת טקסט למקטעים, תמיכה בפורמט SSML ואפשרות אימון נוספת, המבוססות כולן על הפרויקט bark-gui.

מתאים ל

  • יצירת קובץ קול מותאם

    מעלים קובץ דיבור קצר ומקבלים קובץ npz מוכן לשימוש חוזר במודל Bark.

  • הקראת טקסטים ארוכים

    מזינים טקסט וממירים אותו לדיבור תוך שליטה בטמפרטורת היצירה וה־seed.

  • המרת טקסט למבנה SSML

    משתמשים בכפתור המובנה כדי לחלק טקסט למקטעים מותאמים להקראה טבעית יותר.

איפה זה נופל

חומרת מעבד בסיסית אינה מתאימה למודלים כבדים כמו Bark, ולכן ניסיון הרצה ללא שדרוג למאיץ גרפי יוביל לזמני המתנה ארוכים מאוד. בנוסף, הממשק מושהה כרגע בעמוד המקורי ולא מקבל פניות ישירות, והוא כולל תמיכה מפורשת ברכיבי שפה ספציפיים בלבד כגון גרמנית ופולנית לצד האנגלית המובנית.

שאלות
נפוצות

האם אפשר להשתמש באפליקציה כרגע ישירות בדפדפן?

לא, המרחב נמצא כרגע במצב מושהה. כדי להשתמש בו צריך לשכפל את הקוד לחשבון אישי ב־Hugging Face ולהפעיל אותו שם.

כמה זמן לוקח לייצר קטע קול?

המודלים של Bark כבדים מאוד מבחינה חישובית. על גבי מעבד בסיסי כל הפקה תיקח זמן ממושך במיוחד, ולכן ההמלצה הרשמית של היוצר היא לשכפל את הסביבה ולהריץ אותה על מאיץ גרפי.

האם הממשק שומר את קובצי השמע שמעלים אליו?

הקבצים מעובדים מקומית בתוך הסביבה שבה הממשק רץ ומפיקים קובץ npz זמני להורדה. אם משכפלים את המרחב לסביבה פרטית, המידע נשאר מבודד בחשבון שלכם.

האם הכלי תומך בדיבור בעברית?

בקוד המקור שולבו רכיבי שפה ספציפיים לגרמנית ולפולנית לצד המודל הרב-לשוני של BERT. איכות הפקת הדיבור בעברית תלויה לחלוטין ביכולות המובנות של Bark, שאינן מותאמות לעברית באופן רשמי.

איך משתמשים

טוענים קובץ שמע מקומי ליצירת הפרופיל, מקלידים את הטקסט בחלונית הדיבור, ומכוונים פרמטרים כמו טמפרטורת יצירה ומספר חזרות. המרחב נמצא כרגע במצב מושהה ומוגדר על חומרת מעבד בסיסית, כך שאי אפשר להריץ אותו ישירות בלי לשכפל אותו לחשבון פרטי, רצוי עם מאיץ גרפי מתאים כדי לא להמתין דקות ארוכות לכל משפט.

הרישיון

הפרויקט מופץ תחת רישיון MIT, המאפשר שימוש חופשי ושינוי של הקוד. עם זאת, יש לבדוק בנפרד את תנאי השימוש וההגבלות של המודלים הנטענים ברקע, במיוחד suno/bark, לגבי תוצרים מסחריים וזכויות על קולות משוכפלים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗