GPT
O

OmniAvatar-14B

קוד פתוח

OmniAvatarapache-2.02025-06-17

  • Audio-driven
  • text-to-video

הפרויקט הזה מייצר סרטוני וידאו של דמויות מדברות ומזיזות את הגוף ישירות מקובץ שמע ותמונה. הוא נשען על מודל בסיס כבד ומספק שכבת התאמה קלה לדיבור ותנועה.

  • 1.2 GBמשקל הקבצים
  • 111הורדות בחודש
  • 114לייקים

מה זה

המשקלים כאן שוקלים רק 1.2 גיגה בייט כי הם לא מודל וידאו עצמאי, אלא שכבת LoRA ומשקלי התניה קולית. כדי לייצר וידאו צריך להוריד גם את מודל הבסיס Wan2.1 בגודל 14 מיליארד פרמטרים ואת מקודד השמע wav2vec2 של מטא. יחד הם מרכיבים מערכת שלוקחת תמונת מקור, קובץ שמע והנחיית טקסט, ומייצרת סרטון אנימציה של הדמות עם סנכרון שפתיים ותנועות גוף תואמות.

השליטה בהפקה מתבצעת על ידי פיצול ההנחיות. אתם מכוונים בנפרד את ההשפעה של הטקסט שמתאר את הרקע והתנהגות הדמות, ובנפרד את עוצמת הסנכרון לשמע דרך מדד ייעודי. ככל שמעלים את ערך השמע מקבלים התאמת שפתיים הדוקה יותר לקול, בזמן שההנחיה הטקסטואלית ממשיכה להכתיב מה הגוף עושה ברקע.

מתאים ל

  • הנפשת תמונות סטילס לפי קול

    יצירת סרטון אנימציה קצר מתוך תמונת פורטרט בודדת וקובץ שמע קיים.

  • הפקת סרטוני הסבר עם אווטאר

    הנעת דמות בהתאם לקריינות מוקלטת מראש תוך שליטה על תנועות הגוף באמצעות טקסט.

  • מחקר בתחום תנועת גוף מסונכרנת

    בדיקת אלגוריתמים לסנכרון שפתיים והתאמת מחוות דיבור על גבי מודל דיפוזיה פתוח.

איפה זה נופל

הפלט מוגבל כרגע לרזולוציית 480p בלבד, כך שלא תקבלו כאן וידאו חד שמתאים ישירות למסכים גדולים או להפקות מסחריות עתירות פיקסלים. בנוסף יש בעיה מובנית ברצף התנועה. אם בוחרים חפיפה של 13 פריימים מקבלים תנועה חלקה יותר, אבל החוקרים מציינים במפורש שזה גורם להצטברות והתפשטות חמורה של שגיאות לאורך הזמן. הפחתת החפיפה לפריים בודד מקטינה את השגיאות, אבל פוגעת ברציפות הווידאו.

שאלות
נפוצות

האם הקובץ שבעמוד הזה מספיק כדי להריץ את המודל?

לא. הקבצים כאן שוקלים 1.2 גיגה בייט ומכילים רק את שכבת ה־LoRA והשמע. תצטרכו להוריד בנפרד את מודל הווידאו Wan2.1-T2V-14B ואת מקודד השמע wav2vec2-base-960h, בלעדיהם הסקריפטים לא יעבדו.

כמה זיכרון וידאו צריך כדי להריץ אותו על מחשב יחיד?

ללא אופטימיזציה נדרשים 36 גיגה זיכרון בכרטיס מסך, מה שמחייב חומרה מקצועית. אפשר להוריד את הדרישה ל־8 גיגה באמצעות הגבלת פרמטרים בזיכרון, אבל זמן היצירה יתארך משמעותית ויעמוד על כ־22 שניות לכל צעד.

באיזו איכות סרטונים המודל תומך כרגע?

הקוד והמשקלים הנוכחיים תומכים ברזולוציה של 480p בלבד. אפשר להתנסות בהגדלת כמות הטוקנים מ־30,000 ל־60,000 או 80,000 בזמן ההסקה, אך הרזולוציה הבסיסית נשארת מוגבלת.

איך מריצים

ההרצה המקומית דורשת כרטיס גרפי כבד מאוד בגלל מודל הבסיס. על כרטיס A800 יחיד ללא אופטימיזציה צריך 36 גיגה זיכרון גרפי, וכל צעד רינדור לוקח 16 שניות בפורמט bfloat16. אם מפעילים מנגנוני פריקת פרמטרים אפשר לדחוס את הדרישה ל־21 גיגה או אפילו 8 גיגה זיכרון, אבל מהירות ההרצה יורדת ל־22.1 שניות לצעד. עם ארבעה מעבדים גרפיים במקביל ושימוש ב־FSDP, זמן הצעד נחתך ל־4.8 שניות בזיכרון של 14.3 גיגה לכרטיס.

מי שאין לו שרת ייעודי עם חומרה ברמה הזו יתקשה מאוד לייצר כאן סרטונים בקצב סביר, במיוחד כשרצים בין 20 ל־50 צעדים לכל פלט. במצב כזה, סביר יותר להמתין לממשקי ענן שיארחו את הצינור המלא או להשכיר מכונה מרובת כרטיסים לפי שעה לצורכי עיבוד באצ׳.

pip install -U huggingface_hub
hf download OmniAvatar/OmniAvatar-14B

הקבצים

4 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי קוד והפצה חופשית ללא תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון. שימו לב שהמודל תלוי במשקלי הבסיס של Wan2.1 וב־wav2vec2, ולכן הטמעה במוצר מחייבת בדיקה של תנאי הרישיון המקוריים של שני המודלים הנלווים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗