GPT
W

Wan2.2-Animate-14B

קוד פתוח

Wan-AIapache-2.02025-09-11

  • diffusers
  • onnx
  • safetensors
  • video-to-video

מודל אנימציה מבוסס תמונה ווידאו שלוקח דמות בודדת ומעתיק אליה תנועות והבעות מפנים אחרות. שווה לבדוק אותו אם אתם מחפשים החלפת דמויות בווידאו קולנועי בקוד פתוח אמיתי.

  • 17Bפרמטרים
  • 67.4 GBמשקל הקבצים
  • 18,251הורדות בחודש
  • 1,256לייקים

מה זה

מדובר במודל וידאו לוידאו של כ־17 מיליארד פרמטרים ממשפחת Wan2.2, שמיועד לשתי משימות מדויקות. הראשונה היא יצירת הנפשה של תמונת סטילס לפי תנועות של אדם בווידאו קיים, והשנייה היא החלפה מלאה של דמות בתוך סצנה מצולמת תוך שמירה על ההבעות והתאורה המקוריות.

סדרת הדור הנוכחי של Wan נבנתה על ארכיטקטורת תערובת מומחים (MoE) עם מודלים שמפצלים את שלבי הניקוי, לצד אימון על דאטה רחב משמעותית ביחס לגרסאות קודמות, עם תוספת של מעל שמונים אחוז קבצי וידאו. הדגש העיקרי כאן הוא דיוק התנועה המורכבת של הפנים והגוף יחד, במקום פירוק לשלבי הנפשה נפרדים.

מתאים ל

  • החלפת שחקנים בווידאו

    מצב ההחלפה מיועד להלבשת פנים וגוף של דמות מתמונה אחת לתוך צילום קיים תוך התאמת תאורה.

  • הנפשת תמונת סטילס

    מצב ההנפשה משכפל תנועות גוף והבעות פנים מווידאו ומזיז דמות דו מימדית באופן מלא.

  • יצירת דמויות גנרטיביות

    הפקת סצנות של שחקן וירטואלי מתמונה בלבד על בסיס רצף תנועה מוכן מראש ללא ציוד לכידה יקר.

איפה זה נופל

המודל אינו מקבל וידאו גולמי ישירות להסקה. אתם חייבים לעבור שלב עיבוד מקדים שגוזל זמן חישוב, כולל מעקב נקודות ותנועה, ורק אז להריץ את הרשת. בנוסף, המפתחים מזהירים במפורש לא להשתמש במודלי LoRA שאומנו עבור מודלי Wan2.2 הרגילים, כי שינויי המשקלים שוברים את התנהגות מנגנון ההנפשה. תמיכת Diffusers רשמית סומנה ככזו שטרם הושלמה בתיעוד.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי כמו RTX 4090?

הכרטיס הזה לא יספיק להסקה חלקה של 14B ללא אופטימיזציות חריגות ופריקת זיכרון מאסיבית, בגלל גודל של מעל 67 גיגה-בייט. לכרטיס בודד כזה המפתחים הוציאו את גרסת 5B המצומצמת יותר.

האם אפשר להזין לו קובץ וידאו ישירות דרך פקודת פייתון קצרה?

לא. התהליך מחייב הרצת סקריפט עיבוד מקדים שמייצר קבצי עזר מתמונת המקור ומהווידאו, ורק לאחר מכן מעבירים את התיקייה המוכנה למודל הראשי.

איך מריצים

המשקל הכולל מגיע ל־67.4 גיגה-בייט שמחולקים בין 444 קבצים. כדי להריץ את הגודל הזה על שרת מקומי תצטרכו תשתית מרובת כרטיסי מסך שתומכת ב־FSDP ו־DeepSpeed Ulysses, או כרטיס מקצועי יחיד וחזק מאוד עם פריקה רצינית של זיכרון ל־CPU.

ההרצה דורשת שלב עיבוד מקדים מיוחד שמכין את חומרי הגלם מקובץ הווידאו ותמונת המקור באמצעות סקריפט ייעודי לפני תהליך ההסקה עצמו. אם אין לכם גישה למערך של כרטיסי A100 או H100, עדיף להשתמש בסביבות מוכנות כמו ModelScope Studio או Hugging Face Spaces במקום לנסות לדחוף אותו למחשב פיתוח רגיל.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Wan-AI/Wan2.2-Animate-14B")
img = pipe("a photo").images[0]

הקבצים

444 קבצים במאגר, 67.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ ברישיון Apache 2.0 מלא. אתם רשאים להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים פרטיים בלי לשלם תמלוגים, כל עוד שומרים על הודעת הרישיון המקורית. המפתחים אינם תובעים זכויות על התוצרים שיוצאים מהמודל, אך מחייבים אתכם שלא לייצר תוכן בלתי חוקי או פוגעני.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗