GPT
O

OpenVoice — הדגמה

קוד פתוח

myshell-aimit2023-12-26

  • gradio

הדגמה פשוטה לשכפול קול והקראת טקסט לפי דגימת אודיו קצרה. מיועד למי שרוצה לבדוק התאמת סגנונות דיבור וחיקוי קול באנגלית ובסינית.

  • 431 MBמשקל הקבצים
  • הורדות בחודש
  • 1,140לייקים

מה זה

אתם מזינים טקסט, בוחרים סגנון דיבור ומעלים קובץ קול שמשמש כדוגמה למקור. המודל שרץ מתחת הוא OpenVoice, והוא מייצר קובץ אודיו חדש שמקריא את הטקסט שלכם בגוון הקול של הדגימה. הממשק מחזיר נגן עם האודיו המסונתז, לצד הקלט המקורי ששימש אותו.

בקוד מוגדרות מראש שלוש דוגמאות של קבצי קול מוכנים בשמות speaker0 עד speaker2. השפות הנתמכות שרואים בקוד הבדיקות הן אנגלית וסינית, כשהמערכת נעזרת בספריית langid כדי לזהות את שפת הטקסט שהכנסתם.

מתאים ל

  • הקראת טקסט באנגלית בסגנונות

    הפקת דיבור באנגלית עם שליטה ברגש כמו לחישה, כעס, פחד או התלהבות מתוך רשימה מוגדרת.

  • חיקוי גוון קול מדגימה

    בדיקת היכולת של המודל לחקות חתימת קול מתוך קובץ שמע קצר שאתם מעלים.

  • התנסות בקולות דוגמה מוכנים

    יצירת שמע על בסיס שלושה רמקולים מובנים בלי צורך להקליט או להעלות קובץ חיצוני.

איפה זה נופל

רשימת הרגשות מוגבלת לפי השפה. באנגלית יש אפשרויות כמו לחישה, צעקה, שמחה או כעס, אבל בסינית הקוד מתיר רק סגנון ברירת מחדל. אם הטקסט קצר מדי תקבלו אזהרה שמבקשת להאריך אותו. בנוסף, עברית כלל לא מופיעה בקוד, והיוצרים מציינים מראש בתיעוד שאם הקול שנוצר לא נשמע כמו המקור, צריך לפנות למדריך התקלות שלהם.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

הגישה לממשק הזה היא בחינם ואינה דורשת תשלום. אתם רק צריכים לאשר את תנאי השימוש באמצעות סימון תיבה לפני ההרצה. אין כאן מדרגות מחיר שמופיעות בקוד או בעמוד.

כמה זמן לוקח לקבל קובץ שמע?

האפליקציה רצה על מעבד רגיל מסוג cpu-basic ללא כרטיס מסך ייעודי. בגלל סוג החומרה הזה, יצירת האודיו אינה מיידית ועשויה להימשך מספר שניות ואף יותר. הזמן תלוי גם באורך הטקסט שהזנתם.

האם אפשר להשתמש בה עם טקסט בעברית?

הקוד מגדיר בדיקות מפורשות רק עבור אנגלית וסינית באמצעות זיהוי שפה. שפות אחרות לא נתמכות בממשק הזה ועלולות להחזיר שגיאה. לכן היא אינה מתאימה כרגע לעבודה בעברית.

האם אפשר להריץ אותה במחשב מקומי?

כן, הפרויקט כולו מבוסס על קוד פתוח תחת רישיון MIT ומשתמש ב־Gradio. יוצרי המודל מספקים קישורים למאגר ב־GitHub ולמחברת Jupyter להרצה עצמאית. בסביבה שלכם תוכלו לחבר גם כרטיס מסך כדי לשפר את הביצועים.

איך מריצים

בוחרים דגימת קול מהדוגמאות או מעלים קובץ משלכם, כותבים טקסט בתיבה, בוחרים סגנון, מסמנים תיבת אישור לתנאי השימוש ולוחצים על Send. אין פה דרישה להרשמה מוקדמת. החומרה שמוקצית להרצה היא מעבד בסיסי, cpu-basic, כך שאין כאן האצת כרטיס מסך ועיבוד האודיו עשוי לקחת זמן, במיוחד בטקסטים ארוכים.

pip install -U huggingface_hub
hf download myshell-ai/OpenVoice

הרישיון

הפרויקט מפורסם תחת רישיון MIT, שמתיר שימוש חופשי בקוד, כולל עריכה והפצה. עם זאת, השימוש בממשק מחייב לסמן אישור לתנאי שימוש נפרדים, וכדאי לקחת בחשבון שכל קובץ שאתם מעלים מגיע ישירות להרצה מרוחקת ברשת.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗