GPT
W

Wan2.2-I2V-A14B-Diffusers

קוד פתוח

Wan-AIapache-2.02025-07-28

  • diffusers
  • safetensors
  • image-to-video
  • en
  • zh

הופך תמונה יחידה לסרטון וידאו מדויק עם תנועה יציבה ושליטה באסתטיקה קולנועית. מיועד למי שרוצה וידאו באיכות גבוהה בלי לסבול מקפיצות מצלמה מוזרות.

  • 14Bפרמטרים
  • 118 GBמשקל הקבצים
  • 150,952הורדות בחודש
  • 300לייקים

מה זה

המודל מייצר סרטוני וידאו מבוססי תמונה ברזולוציות של 480P ו־720P. המבנה שלו מבוסס על חלוקת מומחים בתהליך הדיפוזיה, מומחה אחד לשלבי הרעש הראשוניים שקובע את המבנה והקומפוזיציה הכללית, ומומחה שני לשלבים המאוחרים שמחדד פרטים עדינים. בפועל זה מאפשר נפח מודל כולל גדול יותר תוך שמירה על דרישות חישוב פעילות של כ־14 מיליארד פרמטרים בכל צעד.

האימון נעשה על מאגר נתונים רחב יותר מקודמו, עם תוספת של מעל שמונים אחוז סרטונים ותיוג מדוקדק של תאורה, צבע וקומפוזיציה. ההבדל המרכזי מול מודלים פתוחים אחרים הוא הפחתה משמעותית של עיוותי תנועה פתאומיים ותנועות מצלמה מנותקות מהמציאות.

מתאים ל

  • הנפשת תמונות סטילס לפרסום

    יצירת סרטוני 720P מתמונות מוצר קיימות, עם תנועת מצלמה יציבה ותאורה קולנועית שמתאימות לקמפיינים דיגיטליים.

  • הפקת תוכן מבוססת ComfyUI

    שילוב ישיר בתהליכי עבודה קיימים בייצור מדיה שדורשים בקרת פריימים הדוקה יותר ממודלי טקסט לווידאו.

  • מחקר ופיתוח וידאו גנרטיבי

    בחינת ארכיטקטורת מומחים בתהליכי דיפוזיה על תשתית פתוחה עם קוד להרצה מבוזרת.

איפה זה נופל

חומרת הבסיס היא צוואר הבקבוק הראשי. כרטיסים ביתיים פשוט לא יריצו אותו בלי קריסה, וזמן היצירה לסרטון בודד ארוך מאוד. הכרטיס מודה שגרסת ה־Diffusers דורשת התקנה ישירה מענף הפיתוח הראשי בגיטהאב ולא עובדת עם הגרסה היציבה הנוכחית של הספרייה. התמיכה בשפות מוגבלת לאנגלית וסינית, כך שפרומפטים בעברית ידרשו תרגום מקדים.

שאלות
נפוצות

אפשר להריץ את המודל הזה על כרטיס RTX 4090 בודד?

לא. המודל דורש לפחות 80 גיגה זיכרון גרפי להרצה על כרטיס יחיד, וגם זה עם פריקה חלקית של מודלים. אם יש לכם כרטיס ביתי, תצטרכו להסתכל על גרסת ה־TI2V-5B שנבנתה מראש לעבוד על 4090.

חייבים לכתוב הנחיית טקסט כדי להנפיש את התמונה?

לא חובה. אפשר לספק רק את תמונת הקלט ולייצר וידאו ישירות ממנה, או להשתמש בהרחבת פרומפט אוטומטית שגוזרת את ההנחיות מתוך התוכן של התמונה עצמה.

איך מריצים

כדי להריץ אותו על כרטיס בודד צריך מפלצת של 80 גיגה זיכרון גרפי לפחות, יחד עם הפעלת פריקה של המודל לזיכרון המערכת והמרת סוגי משתנים. בהפצה אמיתית או בייצור מריצים אותו באשכול של שמונה כרטיסים באמצעות שילוב של FSDP ו־DeepSpeed Ulysses.

המשקלים שוקלים 118 גיגה ב־50 קבצים, מה שהופך את ההורדה וההקמה לעסק כבד. אם המטרה היא בדיקת היתכנות מהירה או שאין לכם חומרה ברמת מרכז נתונים, עדיף לחפש נקודת קצה מנוהלת או להשתמש בגרסת ה־5B הקטנה יותר של אותה משפחה במקום להשכיר שרתים יקרים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Wan-AI/Wan2.2-I2V-A14B-Diffusers")
img = pipe("a photo").images[0]

הקבצים

50 קבצים במאגר, 118 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון אפאצ'י שתיים מאפשר שימוש מסחרי מלא, שינוי קוד והפצה פנימית או חיצונית של התוצרים ללא תמלוגים. היוצרים מצהירים שאין להם זכויות על הווידאו שנוצר, כל עוד השימוש עומד בחוק ובמגבלות הרישיון הבסיסיות של שמירה על הודעות זכויות יוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗