GPT
H

hallo — הדגמה

קוד פתוח

fudan-generative-aimit2024-06-15

  • gradio

הכלי מנפיש תמונת פורטרט בודדת לפי קובץ שמע והופך אותה לסרטון מדבר. הוא מיועד ליוצרי וידאו וחוקרים שרוצים לבחון סנכרון תנועות פנים ודיבור.

  • 10.5 GBמשקל הקבצים
  • הורדות בחודש
  • 162לייקים

מה זה

אתם מעלים תמונת פנים בקובץ סטטי וקובץ שמע עם דיבור, והתוכנה מפיקה קובץ וידאו בפורמט MP4 שבו הדמות מזיזה את השפתיים, מביעה הבעות פנים ומניעה את הראש בהתאמה לקול.

מאחורי הקלעים פועלת ארכיטקטורה היררכית שמשלבת מודל דיפוזיה מסוג Stable Diffusion 1.5, רכיב תנועה מבית AnimateDiff, חילוץ מאפייני קול דרך wav2vec2, וניתוח תווי פנים של InsightFace ו־MediaPipe. בנוסף המערכת כוללת שימוש ברכיבי PixArt-alpha והפרדת קול בעזרת רשת MDX-Net כדי לבודד את הדיבור ולמפות אותו לשינויים ויזואליים בתוך הפורטרט.

לצורך בדיקות פותח מאגר דגימות ייעודי שכולל קובצי קול ותמונות ניסוי, המאפשרים לבחון את המודל ללא צורך בהקלטה עצמית מראש.

מתאים ל

  • הנפשת תמונות סטילס

    יצירת סרטון אנימציה קצר מתוך תמונת פנים יחידה על בסיס קובץ שמע מוקלט.

  • דיבוב דמויות מונפשות

    סנכרון תנועות שפתיים והבעות פנים עבור דמויות וירטואליות לצורכי הדגמה ומחקר.

  • בדיקת סנכרון תנועה וקול

    הרצת קובצי ניסוי מתוך מאגר הדגימות כדי לבחון איכות התאמת תנועת שפתיים לשמע.

איפה זה נופל

ההדגמה הציבורית כלל אינה מתפקדת בדפדפן עקב שגיאת שרת ומגבלת קוד מכוונת, כך שאי אפשר להזין קבצים ולקבל תוצאה בלי לשכפל את המרחב לתשתית חומרה מתאימה. בנוסף, מדובר במודל כבד מאוד שדורש כרטיסי מסך חזקים כמו A100 או L4 כדי לסיים רינדור של שניות בודדות.

שאלות
נפוצות

האם השימוש באפליקציה בחינם?

העמוד פתוח לצפייה ללא תשלום, אך הוא אינו פעיל להרצה ישירה ומציג שגיאה. כדי להריץ את המודל יש לשכפל את המרחב לשרת עם כרטיס גרפי ייעודי בתשלום, או להשתמש בסקריפט חיצוני כמו קולאב.

כמה זמן לוקח לייצר סרטון?

לפי הודעת המפתחים בממשק, עיבוד קטע קול של 5 שניות אורך יותר מ־10 דקות על גבי מאיץ L4. על המעבד הבסיסי שמוגדר במרחב הנוכחי, יצירת הווידאו אינה מעשית כלל.

האם אפשר להריץ את המערכת במחשב מקומי?

כן, המפתחים פרסמו הוראות התקנה לקוד פתוח המיועדות למערכות אובונטו עם כרטיס מסך תומך קודה. תצטרכו להוריד את המשקלים של כל המודלים הנדרשים ולהריץ את פקודת ההסקה המקומית.

במה שונה האפליקציה הזאת מהקוד של המודל?

ממשק הגרדיו נועד לספק חלון עבודה פשוט להעלאת תמונה וקול, אך הוא חסום ומפנה לשכפול פרטי. הקוד המקורי מאפשר שליטה בפרמטרים מתקדמים כמו משקלי תנוחה, הבעות פנים וגודל אזור הפנים.

איך מריצים

לוחצים על כפתור ההפעלה אחרי בחירת תמונה וקובץ קול, אבל המרחב הציבורי חסום להרצה ישירה ומקפיץ שגיאה שמחייבת שכפול מופע פרטי. מעבר לכך, העמוד מוגדר כעת במצב תקלת הרצה ומבוסס על מעבד בסיסי בלבד. לפי נתוני המפתחים, יצירת סרטון משמע של 5 שניות דורשת יותר מ־10 דקות עיבוד אפילו על מעבד גרפי מסוג L4, ולכן הרצה על מעבד רגיל אינה ישימה בפועל.

pip install -U huggingface_hub
hf download fudan-generative-ai/hallo

הרישיון

הרישיון של המרחב והמודלים לא דווח על ידי המפתחים. בהיעדר תנאי שימוש מוגדרים, המעמד המשפטי של התוכן שאתם מעלים ושל הווידאו שנוצר אינו ברור, ולא ניתן לדעת אם מותר להשתמש בתוצרים לצרכים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗