GPT
N

naturalspeech3_facodec — הדגמה

קוד פתוח

amphionapache-2.02024-03-10

  • gradio

הדגמה שמפרקת קול אנושי לגורמים נפרדים ובונה אותו מחדש, כולל המרת קול בין דוברים. היא מיועדת לחוקרי סאונד ומפתחי דיבור שרוצים לבדוק את FACodec בלי להרים סביבה מקומית.

  • 968 MBמשקל הקבצים
  • הורדות בחודש
  • 184לייקים

מה זה

אתם מעלים קובץ קול או בוחרים מתוך הדוגמאות המוכנות, והמערכת משתמשת בקודקים של NaturalSpeech 3 כדי לקודד ולשחזר את האודיו. יש כאן שני ממשקים נפרדים. הראשון מציג שחזור פשוט של הדיבור כדי לבדוק את איכות הדחיסה של המודל. השני לוקח קול מקור וקול ייחוס, מפרק את המאפיינים שלהם ומייצר המרת קול, שבה הדיבור המקורי נשמע בגוון של הדובר השני.

מתחת למכסה רצים קובצי משקולות של FACodec שכוללים אנקודר, דקודר ורדקודר בגרסאות שונות. המודל מפרק את האות לרכיבים כמו תוכן, גוון קול ופרוזודיה, ואז מרכיב אותם מחדש, מה שמאפשר לבודד את סגנון הדובר בלי לשנות את המילים שנאמרו.

מתאים ל

  • בדיקת איכות דחיסת קול

    מעלים קטע דיבור קצר ומשווים את איכות האודיו המשוחזר למקור כדי להעריך את רמת הדיוק של הקודק.

  • המרת קול בין שני דוברים

    טוענים קובץ מקור וקובץ יעד כדי לבדוק איך המודל מעביר את גוון הקול של הדובר השני על גבי הטקסט המקורי.

  • השוואת ביצועי מודל

    מריצים את דוגמאות ברירת המחדל כדי לבחון את היכולת של FACodec בהפרדת פרוזודיה ותוכן בלי להתקין סביבת פייתון.

איפה זה נופל

ההדגמה מתמקדת רק בשכבת הקודק ולא בכל היכולות של מנוע NaturalSpeech 3 המלא ליצירת דיבור מטקסט. הממשק מיועד לקטעי אודיו קצרים יחסית לבדיקת איכות, ולא מתאים לעיבוד קבצים ארוכים ברצף. בנוסף, חומרת Zero מקצה משאבים לפי דרישה, כך שאם יש עומס ייתכן שתמתינו בתור עד שהמעבד הגרפי יתפנה.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, הגישה בדפדפן פתוחה לגמרי ללא תשלום. אתם לא צריכים להכניס אמצעי תשלום או לפתוח חשבון כדי לבדוק אותה.

האם אפשר להריץ את זה מקומית על המחשב?

כן, הקוד מסתמך על חבילת Amphion ומשקולות שזמינות להורדה ביומן המודלים. תצטרכו סביבת פייתון מתאימה ומעבד גרפי סביר כדי להריץ את האנקודר והדקודר עצמאית.

במה הדף הזה שונה מפרויקט NaturalSpeech 3 המלא?

המרחב מציג רק את FACodec, שהוא רכיב הדחיסה ופירוק הדיבור, ולא את כל מערכת ה־TTS שמייצרת דיבור מטקסט מאפס. הוא מתמקד בשחזור והמרת קול מקובץ קיים.

כמה זמן לוקח לעבד קובץ שמע?

העיבוד נמשך לרוב שניות בודדות לקטעים קצרים, בזכות מאיץ A10G שמוקצה להרצה. אם השרת היה במצב שינה, ייתכן עיכוב קל של חצי דקה עד שהחומרה תתעורר.

איך מריצים

לוחצים על הטאב הרצוי, מעלים הקלטה או בוחרים דוגמה מהרשימה, ומפעילים. הכל רץ ישירות בדפדפן דרך ממשק Gradio על גבי חומרת Zero A10G, כך שהעיבוד מקבל כוח של מאיץ גרפי ייעודי ברגע ששולחים בקשה ולא אמור לקחת יותר מכמה שניות לקטעים קצרים. אין צורך בהתחברות או בהרשמה.

pip install -U huggingface_hub
hf download amphion/naturalspeech3_facodec

הרישיון

הרישיון של המרחב לא דווח. המשמעות היא שאין אישור מפורש לשימוש מסחרי בקוד או בתוצרים, וכדאי לבדוק את תנאי המאגר המקורי של amphion בגיטהאב לפני שמשלבים את המודלים בפרויקט אמיתי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗