GPT
D

dreamtalk

רץ בדפדפן

fffiloniרישיון לא דווח2024-01-04

  • docker

מעלים תמונת פנים וקובץ קול, והעמוד מייצר סרטון של הדמות מדברת לפי האודיו. הכלי מיועד למי שרוצה לבדוק הנפשת דיוקנאות בלי להתקין סביבת פיתוח.

  • הורדות בחודש
  • 229לייקים

מה זה

התהליך פשוט למדי מבחינת קלט: אתם מעלים תמונת סטילס יחידה וקובץ אודיו של דיבור, או בוחרים מתוך רשימת דוגמאות מוכנות מראש שכוללת קובץ קול באנגלית. הממשק כולל גם בחירה של סגנון רגשי מתפריט נפתח, כדי להשפיע על הבעות הפנים בזמן הדיבור, ומחזיר קובץ וידאו בפורמט MP4 שנוצר באמצעות moviepy.

מאחורי הקלעים רץ המודל ali-vilab/dreamtalk, שמבוסס על מאמר מחקרי מסוף 2023. המודל מתמקד בסנכרון שפתיים והתאמת הבעות פנים רגשיות לדיבור, כשהמטרה היא לייצר תנועה שנראית טבעית יותר מהנפשה בסיסית של הפה בלבד.

מתאים ל

  • הנפשת תמונת דיוקן

    חיבור קובץ קול לתמונת סטילס כדי להפיק סרטון קצר שבו הדמות מדברת.

  • בדיקת הבעות רגשיות

    בחינת השפעת סגנונות הרגש השונים בתפריט על הבעות הפנים בזמן הדיבור.

  • התנסות במודל DreamTalk

    בדיקת היכולות של המודל של ali-vilab על דוגמאות מוכנות בלי להתקין ספריות מקומית.

איפה זה נופל

הבעיה המיידית היא שהעמוד מושבת כרגע בגלל שגיאת ריצה, ולכן אי אפשר לבדוק שום קלט חדש ישירות באתר. חוץ מזה, המודל מתמקד בהנפשת פנים בלבד מתוך תמונה בודדת, כך שלא תקבלו תנועות גוף רחבות או שליטה מורכבת בזוויות המצלמה. הממשק נשען על קובצי שמע ודוגמאות מוגדרות מראש, וקשה לדעת איך הוא יתמודד עם עברית או עם איכויות הקלטה נמוכות בלי להריץ את הקוד במחשב נפרד.

שאלות
נפוצות

האם אפשר להשתמש באפליקציה בחינם כרגע?

הגישה לעמוד פתוחה ללא תשלום, אבל הוא נמצא במצב תקלה ולא ניתן להריץ עליו שום דבר כרגע. כל עוד הבעיה הטכנית לא נפתרה, אין אפשרות לייצר סרטונים.

כמה זמן לוקח לייצר סרטון?

ההדגמה מוגדרת על מאיץ גרפי מסוג T4-medium, שאמור לייצר סרטונים קצרים בתוך דקות ספורות. בפועל לא ניתן למדוד את הזמן כרגע בגלל שגיאת הריצה של השרת.

האם אפשר להריץ את המערכת במחשב האישי?

כן, הפרויקט ארוז בתוך מכולת דוקר והקוד נשען על המודל ali-vilab/dreamtalk. אפשר להוריד את הקבצים ולהרים את הסביבה באופן עצמאי על חומרה מתאימה.

האם האפליקציה עובדת עם דיבור בעברית?

קובץ ברירת המחדל בממשק הוא באנגלית, ודף הפרויקט לא מציין תמיכה רשמית בשפות אחרות. מאחר שהעמוד מושבת כרגע, צריך להריץ את המודל מקומית כדי לבדוק איך סנכרון השפתיים מתמודד עם עברית.

איך משתמשים

הממשק מציג שדות להעלאת תמונה ושמע, כפתורי בחירה לסגנון והתאמת האודיו, וכפתור הפעלה ראשי שמריץ את העיבוד. העמוד מוגדר לרוץ על מעבד גרפי מסוג T4-medium בתוך מכולת דוקר, חומרה בסיסית שאמורה לספק תוצאות תוך זמן קצר יחסית.

בפועל, כרגע אין אפשרות להשתמש בהדגמה הזו בדפדפן מפני שהיא נמצאת במצב של שגיאת ריצה. כדי להפעיל אותה צריך לחכות שמי שמתחזק את המרחב יתקן את התקלה, או לשכפל את הקוד ולסדר את סביבת הדוקר בעצמכם.

הרישיון

הרישיון של המרחב הזה לא דווח. המשמעות היא שאין הרשאה ברורה לגבי שימוש מסחרי בקוד, במודל או בווידאו שנוצר, וזכויות השימוש בתוכן ובפלט נשארות לא מוגדרות משפטית.

הרישיון המלא ב־Hugging Face ↗