GPT
S

singing_voice_conversion

רץ בדפדפן

amphionmit2023-12-05

  • gradio

הכלי לוקח הקלטה של שירה וממיר את גוון הקול לזה של זמר אחר תוך שמירה על המנגינה. הוא מיועד למוזיקאים ומפיקים שרוצים לבדוק איך שיר יישמע בקול שונה.

  • הורדות בחודש
  • 264לייקים

מה זה

אתם מעלים קובץ שמע של שירה, בוחרים זמר יעד מתוך רשימה מוגדרת מראש, ומקבלים קובץ חדש שבו אותו הביצוע מושר בקול הנבחר. הממשק ממליץ במפורש להשתמש בשירה נקייה בלבד, כמו הקלטות אולפן יבשות או קולות מבודדים משירים, אחרת התוצאה משתבשת.

מאחורי הקלעים רצים שני רכיבים מרכזיים של amphion: מודל המרת שירה ומודל ווקודר שמייצר את גל הקול הסופי. המשתמש יכול לשנות סולם באמצעות מחוון ייעודי ולקבוע את מספר צעדי הדיפוזיה בהרצה, שמשפיעים על איכות הצליל הסופי.

דוגמאות המערכת כוללות הקלטות באנגלית ובסינית, נשיות וגבריות, שהומרו לקולות מוכרים כמו טיילור סוויפט וג'ון מאייר לצד זמרים סינים, כדי להדגים התמודדות עם שפות וסוגי קול שונים.

מתאים ל

  • בדיקת סקיצות בקול שונה

    העלאת שירה יבשה כדי לשמוע איך הלחן נשמע בגוון קול גברי או נשי אחר לפני הקלטה.

  • שינוי מגדר קולי בשירה

    המרה של קול נשי לקול גברי או להפך לצורך עיבוד מוזיקלי, תוך התאמת הסולם במחוון.

  • החלפת קול להקלטות מבודדות

    בדיקת ביצועים קוליים מתוך ערוצי שירה שחולצו משירים קיימים בעזרת זמר היעד.

איפה זה נופל

הכלי מוגבל לרשימת זמרי היעד הקיימת בממשק ואינו מאפשר לאמן קול חדש במקום. הוא דורש שירה מבודדת לחלוטין ולכן שירים מלאים עם ליווי מוזיקלי יישמעו רע מאוד. בנוסף, הדוגמאות המוכנות מציגות תוצאות באנגלית ובסינית, כך שאין שום הבטחה לגבי האופן שבו ההגייה והמבטא בעברית יישמעו לאחר ההמרה.

שאלות
נפוצות

האם השימוש בממשק עולה כסף?

השימוש בדפדפן פתוח לחלוטין ואינו דורש תשלום או מנוי. אתם פשוט נכנסים לעמוד, מעלים קובץ ומבצעים את ההמרה. אין כאן מדרגות מחיר או חיובים נסתרים.

מה קורה עם קובצי השמע שמועלים לעיבוד?

הקבצים נשלחים לשרת לצורך פעולת המודל והפקת האודיו החדש. לא מצוין כמה זמן הם נשמרים בזיכרון המערכת אם בכלל. אם מדובר בהקלטות בלעדיות או חומרים מסחריים שטרם שוחררו, עדיף להיזהר.

כמה זמן לוקח לכל המרה להסתיים?

משך ההמתנה תלוי באורך קובץ השמע ובמספר צעדי הדיפוזיה שבחרתם במחוון. המערכת מופעלת על כרטיס מסך מסוג A10G, ולכן העיבוד לוקח בדרך כלל בין כמה שניות לחצי דקה. אם יש עומס של משתמשים נוספים באותו רגע, ייתכן שתמתינו בתור.

במה הממשק הזה שונה מהרצת המודל המלא?

הממשק בדפדפן מוגבל לזמרי היעד שנבחרו עבורו מראש ומאפשר לשנות רק פרמטרים בסיסיים כמו סולם וכמות צעדים. במודל המלא אפשר לאמן קולות משלכם ולשלוט בכל שלבי העיבוד של הווקודר. הדפדפן מיועד לבדיקה מהירה בלבד בלי התקנות מקומיות.

איך משתמשים

טוענים קובץ שמע לחלון הקלט, בוחרים את זמר היעד ומגדירים אם נדרש שינוי סולם. מכוונים את מספר צעדי הדיפוזיה ולוחצים על Submit. התהליך רץ על מעבד גרפי מסוג A10G קטן, כך שהעיבוד אינו מיידי ולוקח מעט זמן בהתאם לאורך הקטע וכמות הצעדים שנבחרה. אין צורך בהתחברות או בהרשמה.

הרישיון

הקוד מופץ תחת רישיון MIT שמאפשר שימוש חופשי, כולל מסחרי ושינוי קוד. הקבצים שאתם מעלים מעובדים על השרת המארח, ולכן מומלץ להימנע מהעלאת חומרים רגישים שטרם פורסמו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗