GPT
M

MoDA-fast-talking-head

רץ בדפדפן

multimodalartmit2025-08-18

  • gradio

מעלים תמונת פנים וקובץ שמע, ומקבלים סרטון של הדמות מדברת לפי הקול. זה מיועד למי שרוצה לבדוק הנפשת ראש מבוססת אודיו ישירות בדפדפן בלי להתקין סביבת פיתוח.

  • הורדות בחודש
  • 138לייקים

מה זה

האפליקציה מקבלת תמונת מקור של פנים וקובץ שמע שמניע את הדיבור, ומייצרת וידאו מסונכרן. בממשק בוחרים גם רגש מתוך רשימה סגורה ומכוונים את ערך ה־cfg_scale בסליידר כדי לשלוט בעוצמת ההשפעה. המערכת כוללת דוגמאות מובנות מראש, כמו קובץ תמונה שמספרו 7 וקובץ שמע שמספרו 5, כך שאפשר לבדוק את התוצאה עוד לפני שמעלים קבצים משלכם.

מאחורי הקלעים רץ הקוד של LiveVASAPipeline מתוך מודל lixinyizju/moda, יחד עם המודל השפתי google-bert/bert-base-uncased. הצינור הזה מנתח את האודיו ומייצר את תנועות הפנים וההבעות שמתאימות לדיבור, כשהעיבוד של קובצי הקול מתבצע בעזרת ספריית pydub שממירה אותם למבנה wav.

מתאים ל

  • הנפשת תמונת פרופיל

    הופכים תמונת סטילס בודדת לסרטון קצר שמדבר בקול שלכם לפי קובץ הקלטה.

  • בדיקת מודל MoDA

    בוחנים את איכות סנכרון השפתיים והתנועה של LiveVASAPipeline בדפדפן בלי להוריד משקלים.

  • התאמת הבעות פנים לדיבור

    בודקים איך בחירת רגשות שונים ושינוי ה־cfg משפיעים על תנועת הפנים של אותה דמות.

איפה זה נופל

אם קובץ השמע פגום או לא ניתן להמרה לפורמט wav, התהליך ייעצר מיד בהודעת שגיאה. בנוסף, חובה לספק גם תמונה וגם שמע, כשהבעות הפנים מוגבלות לרשימת הרגשות שהוגדרה מראש במערכת. המודל מסתמך על הורדת משקלים מהרשת, כך שאם יש בעיית גישה למאגר המודל או ניתוק רגע, ההרצה תיכשל ולא תקבלו סרטון.

שאלות
נפוצות

האם השימוש באפליקציה הזאת עולה כסף?

לא, הגישה לדמו בדפדפן פתוחה בחינם ללא תשלום. המשאבים מוקצים על גבי חומרת ענן שיתופית, כך שאין צורך במנוי כדי לייצר סרטון. אם המכונה תהיה עמוסה במשתמשים אחרים, ייתכן שתצטרכו להמתין שהתור יתפנה.

כמה זמן לוקח לייצר וידאו?

העיבוד מתבצע על מאיץ מסוג a10g שמופעל לפי דרישה. משך הזמן תלוי באורך קובץ השמע שהעליתם ובמורכבות התנועה שהאלגוריתם מחשב. יש בממשק מד התקדמות שמראה את המצב בכל רגע.

מה קורה לקבצים שאני מעלה לכאן?

התמונות וקטעי השמע נשמרים כקבצים זמניים בשרת כדי לבצע את ההמרה ל־wav ואת הפקת התנועה. הקוד משתמש בספריית tempfile המקומית לצורך החישוב. למרות זאת, זהו שרת ציבורי ולכן עדיף לא להעלות חומרים רגישים או אישיים.

אפשר להריץ את הכלי הזה במחשב שלי?

כן, הקוד מפורסם ברישיון mit ומשתמש בספריות סטנדרטיות כמו gradio ו־torch. תצטרכו להוריד את הקבצים ממאגר lixinyizju/moda ולוודא שיש לכם כרטיס מסך מתאים שמסוגל להריץ את הצינור. בנוסף תצטרכו חיבור לרשת כדי לאפשר למודלים הראשוניים לרדת.

איך משתמשים

טוענים תמונה וקובץ קול, בוחרים רגש, ולוחצים על כפתור Generate Video. הריצה מתבצעת על חומרת zero-a10g שמקצה כרטיס גרפי לפי דרישה. אין צורך בהתחברות מיוחדת כדי להפעיל את הדמו, אבל בגלל השימוש בחומרה שיתופית ייתכן שתמתינו בתור קצר אם יש עומס, וסרגל ההתקדמות מציג את שלבי העיבוד בזמן אמת.

הרישיון

האפליקציה מפורסמת תחת רישיון mit, שמתיר שימוש חופשי, העתקה ושינוי של הקוד. המידע על הרישוי מתייחס למעטפת הקוד של הממשק, ולא מפורט תנאי שימוש נפרד לגבי זכויות היוצרים על התמונות וההקלטות שאתם מעלים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗