GPT
W

whisperspeech-dreamtalk-combo

רץ בדפדפן

fffiloniרישיון לא דווח2024-02-09

  • gradio

מעלים תמונת פנים וטקסט כדי לייצר סרטון שמזיז את השפתיים לפי הדיבור. זה מיועד למי שרוצה לבדוק הנפשת דיוקן יחד עם שכפול קול ישירות בדפדפן.

  • הורדות בחודש
  • 180לייקים

מה זה

התהליך מחבר בין שני כלים נפרדים באותו מסך. אתם מעלים תמונת פנים, כברירת מחדל מופיעה שם תמונה של איינשטיין, ומקלידים את הטקסט שאתם רוצים שהדמות תגיד. בנוסף, אפשר להעלות או להקליט קובץ שמע של דובר כדי לשכפל את הקול שלו, אם כי זה שלב אופציונלי.

מאחורי הקלעים הקוד משתמש ב־WhisperSpeech לייצור השמע והשכפול, וב־DreamTalk להנפשת הפנים והתאמת תנועות השפתיים לסאונד. בסוף התהליך מקבלים קובץ וידאו מוכן שבו הדמות מדברת את הטקסט שהוזן.

מתאים ל

  • הנפשת תמונות היסטוריות

    העלאת דיוקן של דמות מהעבר יחד עם טקסט קצר כדי לראות אותה מדברת בקול מסונתז.

  • בדיקת שכפול קול לסרטון

    הקלטת דגימת קול קצרה ויצירת וידאו שמזיז פנים לפי הקול שהוקלט.

  • ניסוי מהיר לפני התקנה מקומית

    בדיקת איכות השילוב בין WhisperSpeech לבין DreamTalk בלי להגדיר סביבת קוד שלמה.

איפה זה נופל

אם התמונה שהעליתם לא כוללת פנים ברורות, הקוד יזרוק שגיאה מפורשת שהתמונה לא מכילה פנים ולא ייצר כלום. מעבר לזה, הדף מסתמך על שילוב של שני מודלים כבדים, ועל חומרת מעבד חלשה אתם עלולים להיתקל בזמני המתנה ארוכים מאוד או בקריסות כשמנסים טקסטים ארוכים.

שאלות
נפוצות

האם הממשק דורש הרשמה או תשלום?

לא, אפשר להשתמש בו ישירות בדפדפן דרך Hugging Face ללא תשלום. כל מה שצריך זה להעלות קבצים ולהריץ.

למה המערכת מחזירה שגיאה מיד אחרי ההפעלה?

לפי הקוד, אם DreamTalk לא מזהה פנים בתמונה שהעליתם, הוא זורק שגיאה ועוצר. צריך לוודא שהתמונה מציגה פנים ברורות מקרוב.

כמה זמן לוקח לייצר את הווידאו?

המרחב רץ על מעבד בסיסי ולא על כרטיס מסך חזק, ולכן העיבוד המשותף של הקול והווידאו צפוי להיות אטי. מומלץ להתחיל עם טקסטים קצרים מאוד.

האם חובה להקליט קול משלי?

לא, העלאת קובץ שמע לשכפול מוגדרת כרשות. אם לא תעלו אודיו, המערכת תסתמך רק על הטקסט שהקלדתם.

איך משתמשים

לוחצים על כפתור Submit אחרי שמעלים תמונה, מקלידים טקסט ואופציונלית מוסיפים שמע. החומרה שמוגדרת כאן היא מעבד בסיסי, cpu-basic. מכיוון שמדובר בעיבוד של שכפול קול ויצירת וידאו על מעבד רגיל וללא מאיץ גרפי ייעודי, הריצה עלולה לקחת זמן מורגש, בטח אם יש עומס של משתמשים נוספים ברקע.

הרישיון

הרישיון של המרחב הזה לא דווח על ידי היוצר. במצב כזה אין הרשאה ברורה לשימוש מסחרי בקוד או בתוצרים, ולא ידוע באילו תנאים נשמרים הקבצים והאודיו שאתם מעלים לממשק.

הרישיון המלא ב־Hugging Face ↗