GPT
E

fffiloni/EchoMimic

רץ בדפדפן

fffiloniרישיון לא דווח2024-07-22

  • gradio
  • mcp-server

הופך תמונת פורטרט בודדת לסרטון מדבר או שר לפי קובץ שמע. מתאים למי שרוצה לבדוק הנפשת תווי פנים על בסיס קול בלי להגדיר סביבת פיתוח כבדה.

  • הורדות בחודש
  • 161לייקים

מה זה

אתם מעלים תמונת פנים וקובץ סאונד, והממשק מייצר קובץ וידאו שבו הדמות מזיזה את השפתיים, העיניים והראש בהתאמה לקול. לפי דוגמאות הפרויקט, התוצאה מציגה דיבור באנגלית ובסינית, וגם קטעי שירה שבהם תנועות הפה מותאמות לקצב.

מאחורי הקלעים רץ המודל BadToBest/EchoMimic, שמשתמש בנקודות ציון של הפנים לשליטה בתנועה, לצד רכיבי AnimateDiff לייצור רצף הווידאו. בדף נרשם גם שימוש במודלים כמו MaskGCT ו־gpt2, לצד רכיבי עיבוד שמע ממשפחת Whisper ו־UNet שמייצרים את הסנכרון בין הצליל לתמונה.

מתאים ל

  • הנפשת תמונות לשירה

    חיבור קובץ שירה מוזיקלי לפורטרט ליצירת סרטון שבו תווי הפנים זזים לפי הקצב.

  • יצירת דמויות מדברות

    הפיכת תמונת פנים ודיבוב מוקלט לווידאו עם סנכרון תנועות שפתיים באנגלית או סינית.

  • בדיקת איכות הנפשה

    בחינה מהירה של יכולות המודל ישירות מהדפדפן לפני התקנה מקומית על כרטיס מסך.

איפה זה נופל

המודל אומן ונבדק בעיקר על אנגלית וסינית מנדרינית, ולכן התאמת תנועות השפתיים להקלטות בעברית עלולה להיות פחות מדויקת. בנוסף, חומרת ההדגמה בענן מוגבלת ביחס למחשבי עיבוד מקומיים, ולכן עיבוד של קובצי שמע ארוכים או תמונות מורכבות עלול להיכשל או להסתיים בניתוק.

אותה משפחה

EchoMimic יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם השימוש באפליקציה כרוך בתשלום?

הגישה לממשק דרך הדפדפן היא בחינם. היא נשענת על חומרת zero-a10g שמסופקת במסגרת הפלטפורמה.

כמה זמן לוקח לייצר סרטון?

בגרסאות המואצות של המודל מדובר על סדר גודל של כחמישים שניות ל־240 פריימים על חומרה מקבילה. בממשק הדפדפן הזמן יכול להתארך אם המכונה צריכה להידלק או אם יש עומס.

האם אפשר להריץ את זה מקומית במחשב?

כן, הקוד פתוח בגיטהאב וניתן להרצה מקומית או דרך ComfyUI. התיעוד מציין דרישה לכרטיסי מסך חזקים כמו V100, RTX4090D או A100 עם תמיכה ב־CUDA.

האם הקבצים שמעלים נשמרים?

הרישיון והגדרות הפרטיות של המרחב לא דווחו. לא מומלץ להעלות תמונות פרטיות או הקלטות קול רגישות לשרת שאינו בשליטתכם.

איך משתמשים

טוענים תמונה וקובץ שמע בממשק Gradio ולוחצים על כפתור ההרצה. מכיוון שהאפליקציה רצה על חומרת zero-a10g, המשאבים מוקצים רק בעת בקשה בפועל, כך שהרצה ראשונה עשויה לדרוש זמן התעוררות. זמן העיבוד לפרויקט עומד על כחמישים שניות ל־240 פריימים בגרסאות המואצות, אך בדפדפן זמן ההמתנה תלוי בעומס השרת ובתור המשתמשים באותו רגע.

הרישיון

הרישיון של המרחב הזה לא דווח. המשמעות היא שאין תנאי שימוש ברורים לגבי שימוש מסחרי בתוצרים, ולא ידוע מה רמת הפרטיות של תמונות או קובצי שמע שאתם מעלים לממשק.

הרישיון המלא ב־Hugging Face ↗