GPT
T

tts-hallo-talking-portrait

רץ בדפדפן

fffiloniרישיון לא דווח2024-06-26

  • gradio

המרת תמונת פנים וקובץ קול קצר לסרטון שבו הדמות מדברת ומזיזה את הראש. פתרון שמיועד למי שרוצה לבדוק הנפשת דיוקנאות בלי להגדיר סביבת עבודה מקומית.

  • הורדות בחודש
  • 255לייקים

מה זה

אתם מעלים תמונת פנים או יוצרים אחת במקום בעזרת פרומפט שנשלח למודל חיצוני כמו SDXL Lightning. באגף האודיו אפשר להעלות הקלטה מוכנה או להפיק קול מטקסט ישירות בממשק, דרך לשוניות ייעודיות שמחוברות למנועים חיצוניים כמו Parler TTS, WhisperSpeech או MaskGCT לצורך שכפול קול. לאחר מכן הממשק מזין את התמונה ואת האודיו אל תוך מודל הבסיס Hallo שמייצר את האנימציה הסופית.

התוצר שמתקבל הוא קובץ וידאו שבו תווי הפנים של הדמות נעים בהתאמה מדויקת לקול. הטכנולוגיה מבוססת על משקלי המודל של fudan generative ai hallo, כאשר הקוד מאחורי הממשק נעזר בחיבורי API למרחבים מקבילים כדי לטפל ביצירת התמונות והפקת הדיבור לפני שלב ההנפשה. הממשק מסודר בשלושה עמודות ברורות של שלבי עבודה, מטעינת הדיוקן והקול ועד לצפייה בתוצאה המוגמרת.

מתאים ל

  • בדיקת אנימציה מדיוקן סטטי

    הנפשת צילום פנים קיים בעזרת קובץ קול קצר לבחינת איכות התנועה.

  • יצירת קליפ דיבור קצר

    הפקת דמות בדיונית מטקסט וסנכרון הקראת משפט קצר באמצעות Parler TTS.

  • ניסוי שכפול קול והנפשה

    שילוב דגימת קול חיצונית עם מודל MaskGCT להנעת שפתיים בסרטון.

איפה זה נופל

ההגבלה הקשיחה ביותר בקוד חוסמת כל קובץ שמע שעולה על ארבע שניות. מעבר לזה, יצירת התמונה וסוגי הדיבור השונים תלויים לחלוטין בממשקי API של ספייסים חיצוניים, ואם הם אינם זמינים הפעולה נכשלת מיד עם שגיאה שמבקשת להעלות קובץ ידנית במקום.

שאלות
נפוצות

האם האפליקציה פועלת עכשיו בחינם בדפדפן?

היא מוגדרת כרגע במצב PAUSED ולכן אינה זמינה לשימוש מיידי ברשת. כדי להשתמש בה יש לשכפל את המרחב לחשבון אישי ולהפעיל אותו על חומרה מתאימה בתשלום, או להריץ את הקוד עצמאית. בסביבה ציבורית פתוחה השימוש בממשק לא דרש תשלום.

כמה זמן מותר לקובץ השמע להיות?

הקוד כולל בדיקה שחוסמת קבצים שאורכם מעל ארבע שניות. אם תנסו להעלות או להפיק אודיו ארוך יותר, הממשק יזרוק שגיאה מפורשת ויעצור את התהליך. המטרה היא למנוע עומס כבד על מודל הווידאו.

מה קורה לתמונות ולקולות שמעלים?

הקבצים מעובדים על השרת שמריץ את המרחב ונשמרים זמנית בדיסק המקומי לצורך יצירת הווידאו באמצעות ffmpeg. בנוסף, אם משתמשים במחוללי הקול והתמונה המובנים, הנתונים נשלחים לשרתים אחרים שמארחים את המודלים האלה. לא מצוין תהליך שמירה קבוע מעבר לפעולת ההסקה.

במה היישום הזה שונה מהרצת Hallo ישירות?

הוא אורז את Hallo בתוך ממשק גרפי ומחבר אליו מודלים נוספים ליצירת תוכן ראשוני. במקום להביא תמונה וקול מעובדים מהבית, הממשק מאפשר לייצר אותם במקום בעזרת פרומפטים. המודל עצמו רק מקבל את הקבצים ומייצר את תנועת הפנים.

איך משתמשים

טוענים תמונה וקובץ שמע, או מזינים טקסט באחת הלשוניות להפקת דיוקן וקול, ולוחצים על כפתור Go talking Portrait. החומרה המיועדת להרצה היא מאיץ a10g large, אך כרגע המרחב נמצא במצב PAUSED כך שאי אפשר להריץ אותו ישירות בדפדפן בלי להפעיל אותו מחדש. בנוסף, הממשק דורש אודיו באורך של עד ארבע שניות בלבד, כך שלא תוכלו להנפיש קטעי דיבור ארוכים.

הרישיון

הרישיון לא דווח במאגר. המשמעות היא שאין הרשאה ברורה ומפורשת לשימוש מסחרי בקוד או בתוצרים, ויש לבדוק את תנאי הרישיון המקוריים של המודלים המעורבים כמו Hallo לפני כל שימוש שאינו בדיקה פרטית.

הרישיון המלא ב־Hugging Face ↗