GPT
F

FantasyTalking — הדגמה

קוד פתוח

acvlabapache-2.02025-04-28

  • gradio

הכלי מנפיש תמונת פנים לפי קובץ שמע והופך אותה לסרטון מדבר. הוא מיועד ליוצרי וידאו ומפתחים שרוצים לבדוק דיבוב תמונות בלי להרים סביבה מקומית.

  • 3.1 GBמשקל הקבצים
  • הורדות בחודש
  • 152לייקים

מה זה

מעלים תמונת פנים וקובץ אודיו, ומוסיפים תיאור טקסטואלי שמנחה את התוצאה. הממשק מחזיר קובץ וידאו שבו הדמות זזה ומדברת בהתאמה לקול. יש גם הגדרות לשליטה במספר הפריימים, גודל התמונה, מספר צעדי הדגימה ומשקל השמע לעומת הטקסט.

מאחורי הקלעים רץ שילוב של כמה מודלים כבדים. הוא משתמש ב־Wan2.1-I2V-14B ליצירת הווידאו מתמונה, ב־wav2vec2 של פייסבוק כדי לפענח את גלי הקול ולסנכרן את התנועה, ובמודל הייעודי של FantasyTalking. הממשק מציג גם דוגמאות מוכנות שאפשר להריץ ישירות כדי לראות איך זה עובד.

מתאים ל

  • הנפשת תמונות לפרויקט

    יצירת סרטון קצר שבו דמות סטטית מקריאה משפט מתוך קובץ קול קיים.

  • בדיקת מודל Wan2.1

    בחינת יכולות הסנכרון בין אודיו לווידאו לפני שמורידים את המשקלים למחשב.

  • יצירת אווטאר מדבר

    דיבוב תמונת פרופיל או דמות מאוירת עם הנחיית טקסט מלווה לתנועה.

איפה זה נופל

המודל כבד מאוד ומייצר סרטונים קצרים בלבד, כך שלא תוכלו לזרוק אליו פודקאסט שלם ולקבל וידאו רציף. איכות התנועה של הפנים תלויה ישירות בחדות התמונה ובאיכות ההקלטה, וכל תנועה מורכבת מעבר לדיבור בסיסי עלולה לייצר מריחות מוזרות.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, הגישה דרך הדפדפן חופשית לגמרי. היא רצה על תשתית שיתופית עם חומרת A10G שמוקצית לפי דרישה. אם יש עומס של משתמשים, פשוט תצטרכו להמתין בתור.

מה קורה עם הקבצים שאני מעלה?

התמונות והשמע נשלחים לשרת לצורך יצירת הווידאו בלבד. הם נשמרים זמנית בספריית העבודה כדי שהמודלים יוכלו לעבד אותם. לא כדאי להעלות לשם חומרים רגישים או סודיים.

כמה זמן לוקח לייצר סרטון?

זה תלוי באורך הסרטון ובמספר הצעדים שתבחרו בהגדרות. בגלל שהמערכת מריצה מודל של 14 מיליארד פרמטרים, כל יצירה לוקחת בדרך כלל כמה דקות. אם המעבד הגרפי היה כבוי, יש עוד חצי דקה של טעינה ראשונית.

אפשר להריץ את זה על המחשב בבית?

כן, הקוד פתוח תחת רישיון אפאצ'י ומשתמש בספריות סטנדרטיות כמו Gradio ו־PyTorch. עם זאת, תצטרכו כרטיס מסך חזק מאוד עם כמות זיכרון נכבדת כדי להחזיק את המודל המלא. בלי כרטיס מתאים, התוכנה פשוט תתרסק מחוסר זיכרון.

איך מריצים

טוענים תמונה, בוחרים אודיו ולוחצים על כפתור Generate Video. ההרצה מבוססת על תשתית Spaces עם חומרת Zero-A10G, מה שאומר שהמעבד הגרפי מוקצה רק בזמן החישוב. כשיש עומס או משתמשים נוספים בתור, זמן ההמתנה יתארך, ועיבוד של מודל וידאו בגודל 14 מיליארד פרמטרים ייקח כמה דקות טובות.

pip install -U huggingface_hub
hf download acvlab/FantasyTalking

הקבצים

4 קבצים במאגר, 3.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמערכת זמינים תחת רישיון apache-2.0, שמאפשר שימוש חופשי כולל שימוש מסחרי והתאמות בקוד. לגבי התמונות וקבצי השמע שאתם מעלים, הזכויות נשארות שלכם בכפוף לתנאי השימוש של שרתי האחסון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗