GPT
S

Seed-VC — הדגמה

קוד פתוח

Plachtagpl-3.02024-09-03

  • gradio

המרת קול ללא אימון מוקדם על בסיס קטע שמע קיים ודגימת יעד קצרה. מתאים למי שרוצה לשנות דיבוב או שירה לקול של אדם אחר.

  • 3.7 GBמשקל הקבצים
  • הורדות בחודש
  • 519לייקים

מה זה

אתם מעלים שני קובצי קול, מקור להמרה ודגימת יעד של הקול שרוצים לקבל. הממשק מאפשר לשלוט במספר צעדי הדיפוזיה בין 1 ל־200, לשנות את מהירות הדיבור, להפעיל מודל מבוסס F0 ולכוונן את גובה הצליל בטווח של פלוס מינוס 24 חצאי טונים. בסיום העיבוד מקבלים נגן להאזנה מיידית בהזרמת שמע ועוד נגן עם קובץ WAV מלא להורדה.

מאחורי הקלעים הקוד רותם שרשרת מורכבת של מודלים. חילוץ התוכן והתכונות נשען על Whisper של OpenAI ועל מודל CAMPPlus לזיהוי דובר, מודל RMVPE מטפל בגובה הצליל, ורכיבי BigVGAN של אנבידיה משמשים כווקודר לשחזור אות השמע באיכות 22 או 44 קילו-הרץ. הדוגמאות המובנות בממשק ממחישות גם דיבור רגיל וגם שירה, כמו קטע ווקאל של שיר מוכר שמומר לקול של דמויות שונות תוך הנמכת הטון.

מתאים ל

  • המרת שירה לקול אחר

    סימון אפשרות ה־F0 והתאמת גובה הטון מאפשרים להלביש גוון קול חדש על שירה מוקלטת.

  • החלפת דובר בהקלטות

    מעלים קטע דיבור קצר ודגימת יעד כדי לקבל את אותו הטקסט בדיוק בקול חדש.

  • התאמת קצב דיבור באודיו

    מחוון התאמת האורך מאפשר להאיץ או להאט את הפלט בטווח שבין חצי למהירות כפולה.

איפה זה נופל

ההדגמה מוגבלת לשמיעה והורדה ישירה, ללא עריכת אודיו מתקדמת או חיתוך זמנים בממשק עצמו. למרות השימוש במודל Whisper, הממשק אינו כולל התאמה ייעודית לעברית ואיכות ההמרה תלויה מאוד ברמת הרעש בקובץ המקור. הדוגמאות המוכנות נבחרו בקפידה עם קטעים מבודדים ונקיים, ובמציאות קובץ שמכיל מוזיקת רקע כבדה יישמע מקוטע או מעוות.

שאלות
נפוצות

האם השימוש באפליקציה הזאת עולה כסף?

השימוש בממשק הדפדפן הוא חינמי לגמרי ואינו דורש תשלום. המשאבים מוקצים על בסיס חומרה שיתופית של Hugging Face. אין צורך להכניס כרטיס אשראי או ליצור חשבון כדי לנסות אותה.

מה קורה עם קובצי האודיו שמעלים למערכת?

הקבצים נשלחים לעיבוד על השרת שמריץ את ההדגמה ומנוגנים חזרה בדפדפן. הם נשמרים זמנית לצורך הריצה של סקריפט ה־Python בלבד. מומלץ לא להעלות חומרים רגישים או סודיים לשרתים ציבוריים.

כמה זמן לוקח לכל המרה להסתיים?

הזמן משתנה לפי אורך ההקלטה וכמות צעדי הדיפוזיה שתגדירו, כאשר ברירת המחדל היא 25 צעדים. בזכות השימוש במאיץ A10G ובהזרמת שמע, התוצאה הראשונית מגיעה בתוך שניות בודדות. אם יש עומס משתמשים בתור הציבורי, ייתכן שתמתינו מעט יותר.

האם אפשר להריץ את הכלי הזה במחשב המקומי?

כן, הקוד פתוח וזמין במאגר הגיטהאב של המפתח להורדה והתקנה עצמאית. תצטרכו מחשב עם מעבד גרפי תומך כדי להריץ את שרשרת המודלים הכבדה שכוללת את BigVGAN ו־Whisper. הממשק המקומי מאפשר עבודה חופשית בלי תלות במגבלות השרת הציבורי.

איך מריצים

גוררים את שני קובצי האודיו לממשק ולוחצים על הפעלה. אם מדובר בשירה, חובה לסמן את תיבת ה־F0. העיבוד רץ על מעבד גרפי מדגם A10G בתצורת שיתוף משאבים, כך שההמתנה תלויה בעומס המשתמשים באותו רגע ובמספר צעדי הדיפוזיה שתבחרו. אין צורך להתחבר או להירשם כדי להשתמש בהדגמה.

pip install -U huggingface_hub
hf download Plachta/Seed-VC

הרישיון

הקוד מופץ תחת רישיון gpl-3.0, שמחייב קוד פתוח תחת אותו רישיון לכל פיתוח שמשתמש בו. הרישיון חל על התוכנה, אך מעמדם המשפטי של קובצי האודיו שמעלים או מפיקים נשען על זכויות היוצרים של ההקלטות המקוריות.

הרישיון המלא בעמוד המודל ↗