GPT
M

MuseTalk — הדגמה

קוד פתוח

TMElyralabcreativeml-openrail-m2024-04-10

  • docker

סנכרון שפתיים של פרצוף מתוך סרטון לפי קובץ שמע חיצוני. זה מיועד למי שרוצה לבדוק דיבוב אוטומטי של דמות קיימת בלי להקליט אותה מחדש מול מצלמה.

  • 6.3 GBמשקל הקבצים
  • הורדות בחודש
  • 77לייקים

מה זה

מעלים סרטון וידאו של פנים ומצרפים קובץ אודיו שרוצים להלביש עליו. יש גם פרמטר מספרי בשם bbox_shift בטווח של מינוס תשע עד תשע, שמכוון ידנית את מיקום המסגרת מסביב לפה כדי שהחיתוך יצא מדויק. הפלט שמתקבל הוא קובץ וידאו חדש שבו תנועות הפה מותאמות לצלילים שהזנתם.

מאחורי הקלעים הקוד מושך כמה מודלים יחד. DWPose מחלץ נקודות ציון של הפנים והגוף, המודל MuseTalk מחשב את תנועת השפתיים, ומשתמשים גם ב־VAE של Stability AI לצד רכיבים נוספים לעיבוד התמונה והמיזוג שלה בחזרה לסרטון המקורי.

מתאים ל

  • דיבוב סרטון קיים

    הלבשת שמע בשפה אחרת על פנים של אדם שמדבר בווידאו, כך שתנועות הפה יתאימו לקול החדש.

  • הנפשת תמונות מדברות

    הפיכת הקלטה קולית לסרטון פנים מדבר על בסיס קטע וידאו קצר של דמות קבועה.

  • התאמת שפתיים לקריינות

    תיקון תנועות הפה של מציג בשיעור מוקלט או סרטון הדרכה בעקבות החלפת קובץ ההסבר הקולי.

איפה זה נופל

הבעיה המיידית היא שההדגמה שבורה ולא תעבוד לכם כרגע בדפדפן בגלל RUNTIME_ERROR. חוץ מזה, הממשק דורש התעסקות ידנית במיקום התיבה של הפה, ואם המספר לא מדויק התוצאה תיראה מרוחה או מנותקת. המערכת רק מזיזה את השפתיים והאזור התחתון של הפנים על גבי הסרטון הקיים, ולא מייצרת הבעות פנים חדשות או תנועות ראש מעבר למה שיש בווידאו המקורי.

שאלות
נפוצות

האם השימוש בהדגמה בדפדפן עולה כסף?

לא, הגישה להדגמה היא בחינם ואינה דורשת תשלום. עם זאת, נכון לעכשיו היא תקועה על שגיאת ריצה ולא תפיק פלט.

מה קורה לקבצים שמעלים לעמוד?

הקבצים נשלחים לעיבוד על גבי השרת שמריץ את הקוד ונשמרים שם זמנית לצורך יצירת הווידאו. מאחר שמדובר בהדגמה פומבית על שרת מרוחק, עדיף לא להעלות חומרים רגישים.

האם אפשר להריץ את הכלי על המחשב?

כן, המערכת מוגדרת כולה בקוד פתוח בתוך קונטיינר של דוקר, והמשקולות מפורסמות ברשת. כדי להריץ אותה מקומית צריך מחשב עם מעבד גרפי מתאים של אנבידיה והתקנה של החבילות הנדרשות.

למה הממשק בדפדפן לא מייצר וידאו?

המופע הנוכחי מדווח על סטטוס תקול בקוד ההפעלה. עד שהמפתחים יתקנו את התקנה או ירימו את המופע מחדש, הדרך היחידה להשתמש בו היא להוריד את הקוד ולהריץ אותו באופן עצמאי.

איך מריצים

טוענים קובץ אודיו וקובץ וידאו לשדות המתאימים, משאירים את ערך ברירת המחדל של מסגרת הפה על מינוס אחת או מתקנים אותו מעט, ולוחצים על Generate. הממשק כולל מד התקדמות מובנה שמבוסס על tqdm, כך שאפשר לראות בזמן אמת באיזה שלב הרינדור נמצא. השרת מוגדר לרוץ על חומרת a10g-small של אנבידיה, שאמורה לתת כוח עיבוד גרפי סביר למודלים כאלה, אבל נכון לעכשיו אי אפשר להריץ כלום ישירות בדפדפן כי המופע נמצא במצב של שגיאת ריצה.

pip install -U huggingface_hub
hf download TMElyralab/MuseTalk

הקבצים

6 קבצים במאגר, 6.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מפורסם תחת רישיון creativeml-openrail-m. הוא מתיר שימוש חופשי וגם מסחרי במודל, כל עוד עומדים בהגבלות השימוש ההוגן שמוגדרות ברישיון ונמנעים מיצירת תוכן פוגעני או זיוף מטעה.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗