GPT
W

Wan2.2-S2V-14B

קוד פתוח

Wan-AIapache-2.02025-08-25

  • diffusers
  • safetensors
  • s2v
  • image-to-video
  • es

הופך תמונה יחידה וקובץ שמע לסרטון תואם שפתיים ותנועה באיכות קולנועית. מתאים למי שרוצה אנימציית דמויות ריאליסטית בלי לצלם שחקנים מחדש.

  • 16Bפרמטרים
  • 45.8 GBמשקל הקבצים
  • 9,435הורדות בחודש
  • 466לייקים

מה זה

הגרסה הזו מתמקדת בדיבור לקולנוע דרך וידאו. בניגוד לכלים שמזיזים רק את אזור הפה כמו ראשים מדברים קלאסיים, הוא מייצר תנועת גוף שלמה, התנהגות מצלמה דינמית ותאורה מותאמת לפי קול וטקסט מנחה. המודל תומך בהזנת תמונה, קטע אודיו, וגם סרטון שלדי שלד כדי להכתיב פוזה מדויקת במקביל לשמע.

הבסיס נשען על אימון רחב בהרבה לעומת הגרסאות הקודמות של הפרויקט, עם תוספת של שמונים ושלושה אחוזים יותר וידאו. ההבדל מול פתרונות קיימים כמו אווטארים בסיסיים מתבטא בשמירה על אסתטיקה קולנועית, עבודה ברזולוציות של 480P ועד 720P, ויכולת להפיק סרטונים ארוכים יחסית תוך סנכרון שפתיים מדויק.

מתאים ל

  • סנכרון שפתיים לדיבוב

    התאמת תנועת הפה של דמות מצולמת לשפת דיבוב חדשה על בסיס קובץ סאונד בלבד.

  • אנימציית דמויות מתמונה

    הפקת סרטון משחק מלא מתמונת קונספט סטטית והקלטת קול של שחקן.

  • שילוב תנועה מונחית פוזה

    יצירת דמות שמבצעת תנועות גוף לפי קובץ וידאו מנחה תוך שירה מדויקת לפי קצב.

איפה זה נופל

דרישות החומרה חוסמות כמעט כל מחשב פיתוח רגיל. כרטיסים צרכניים פשוט לא באים בחשבון לגרסה הזו בלי שיטות קוונטיזציה חיצוניות שלא מגיעות בקוד המקורי. בנוסף, אף שהמודל מנסה לייצר תנועה מורכבת של כל הגוף, התוצאה מושפעת ישירות מאיכות תמונת המקור. זווית חדה מדי או שמע עם רעשי רקע יגררו עיוותים גלויים לעין בהבעות הפנים ובקצב תנועת השפתיים.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי כמו RTX 4090?

לא עם הקוד הרשמי. המודל דורש לפחות שמונים גיגה זיכרון וידאו לכרטיס יחיד, כך שכרטיס ביתי עם עשרים וארבעה גיגה פשוט יקרוס מחוסר זיכרון, אלא אם משתמשים בכלים קהילתיים של קוונטיזציה והורדת עומסים.

מה צריך להזין כדי לייצר סרטון?

ההזנה דורשת תמונת מקור וקובץ שמע. אפשר להוסיף גם תיאור טקסטואלי שמכוון את האווירה, או סרטון עם תנועות גוף מוגדרות מראש שעל פיהן המודל ילביש את הדמות והדיבור.

איך מריצים

בשביל להריץ אותו על כרטיס בודד חייבים מאיץ גרפי עם לפחות שמונים גיגה זיכרון וידאו, לצד שימוש בפריקת זיכרון ל־CPU והמרת סוגי נתונים. במערך של כמה כרטיסים משתמשים ב־FSDP וב־DeepSpeed Ulysses על פני ארבעה או שמונה מאיצים מקבילים כדי לחלק את העומס של קובצי המשקל שמגיעים כמעט לארבעים ושישה גיגה.

מי שאין לו שרת ענן עם חומרת שרתים ייעודית של אנבידיה לא יצליח להריץ את זה מקומית. עבור בדיקות ראשוניות או פיתוח קל, עדיף להשתמש בנקודות הקצה של HuggingFace או ModelScope במקום לשכור מאיצי שרתים יקרים לחודש שלם.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Wan-AI/Wan2.2-S2V-14B")
img = pipe("a photo").images[0]

הקבצים

49 קבצים במאגר, 45.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון Apache 2.0 מלא. אפשר להשתמש במודל לפרויקטים מסחריים, לשנות את הקוד, להטמיע במוצר ולהפיץ אותו חופשי, בלי תשלום תמלוגים. התנאי הוא מתן קרדיט והצמדת עותק הרישיון המקורי, לצד איסור שימוש להפצת מידע כוזב או תוכן פוגעני.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗