GPT
W

Wan2.1-I2V-14B-720P

קוד פתוח

Wan-AIapache-2.02025-02-25

  • diffusers
  • safetensors
  • i2v
  • video
  • video genration

הפיכת תמונה סטטית לווידאו ברזולוציית 720P עם תמיכה בהוראות באנגלית ובסינית. הוא מתאים למי שרוצה בסיס קוד פתוח כבד שמסוגל לייצר גם טקסט ברור בתוך הפריימים.

  • 16Bפרמטרים
  • 76.6 GBמשקל הקבצים
  • 14,523הורדות בחודש
  • 602לייקים

מה זה

מדובר במודל דיפוזיה מסוג Diffusion Transformer בהיקף של 16 מיליארד פרמטרים, שמיועד לקחת תמונה קיימת ולהנפיש אותה לפי תיאור טקסטואלי. הארכיטקטורה משלבת מודל קידוד טקסט מסוג T5 ורכיב VAE תלת ממדי ייעודי שפותח עבור הפרויקט. המטרה של הרכיבים האלה היא לשמור על רצף תנועה יציב ולדחוס את המידע בציר הזמן בלי לאבד חדות.

הייחוד שלו מול מתחרים בקטגוריה הוא היכולת לשלב טקסט גרפי קריא באנגלית ובסינית ישירות בתוך הווידאו שנוצר. היוצרים מדווחים על עדיפות במבחני הערכה אנושית מול מודלים פתוחים וסגורים, אם כי המדדים מבוססים על מבחנים פנימיים שהם עצמם הגדירו ולא על סקר בלתי תלוי.

מתאים ל

  • הנפשת מוצרים לשיווק

    יצירת סרטוני הדגמה מתמונת מוצר סטטית ברזולוציית 720P כולל שמירה על יחס הממדים המקורי של התמונה.

  • שילוב טיפוגרפיה בווידאו

    הנפשת סצנות המכילות כותרות או שלטים ברורים באנגלית ובסינית, תחום שבו רוב מודלי הווידאו נכשלים.

  • הפקת תוכן מבוסס תסריט

    שרשור יצירה מתמונות מפתח קבועות מראש תוך שימוש בהרחבת פרומפטים מבוססת ראייה ממוחשבת.

איפה זה נופל

הבעיה המרכזית היא חוסר גמישות ברזולוציה. המשקלים האלה מייצרים וידאו ב־720P בלבד ולא מאפשרים ירידה ל־480P כדי לחסוך זמן חישוב, אלא אם מורידים קובצי מודל אחרים. תמיכת השפות מוגבלת לאנגלית ולסינית בלבד, כך שטקסט בעברית לא יעבוד בהנחיות או ביצירת כתוביות בתוך הפריים. בנוסף, נכון לפרסום, התמיכה בספריות נפוצות כמו Diffusers ו־ComfyUI עדיין מסומנת כתוכנית עבודה שטרם הושלמה בקוד.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב אישי עם כרטיס מסך ביתי?

המשקל הכולל של הקבצים מגיע ל־76.6 גיגה בייט ומחייב זיכרון גרפי עצום. קיימת אפשרות להשתמש בפריקת משקלים לזיכרון הראשי עם offload_model, אך הביצועים יהיו איטיים מאוד בהשוואה למערך מרובה כרטיסים.

האם אפשר לתת לו הנחיות בעברית?

המודל אומן ומיועד לעבודה באנגלית ובסינית בלבד. הנחיות בעברית ככל הנראה לא יניבו תוצאות עקביות, ועדיף לתרגם את התיאור לאנגלית לפני השליחה.

האם המודל תומך בייצור וידאו מטקסט בלבד?

הקובץ הספציפי הזה מיועד אך ורק להמרת תמונה לווידאו ב־720P. למשימות טקסט לווידאו קיימים משקלים ייעודיים ונפרדים של אותה סדרה.

איך מריצים

כדי להריץ מודל של כמעט 77 גיגה בייט צריך מערך שרתים רציני. הקוד תומך בהרצה על כרטיס בודד באמצעות פריקת משקלים לזיכרון המערכת עם הדגל offload_model, אבל ברירת המחדל היעילה לתפוקה סבירה היא חלוקה למספר כרטיסים גרפיים בעזרת FSDP וספריית xfuser.

הגרסה הזו נעולה לרזולוציית 720P בלבד, ולמי שרוצה לעבוד ב־480P יש משקלים נפרדים לגמרי. אם אין לכם שרת ייעודי עם נפח זיכרון גרפי מסיבי, קריאה ל־API חיצוני כמו DashScope להרחבת פרומפטים או לעיבוד תחסוך את עלויות החומרה הכבדות.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Wan-AI/Wan2.1-I2V-14B-720P")
img = pipe("a photo").images[0]

הרישיון

המודל שוחרר תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי של הקוד והפצה חופשית. היוצרים אינם דורשים זכויות על התוכן שנוצר, אך מטילים על המשתמש את האחריות המלאה לוודא שהשימוש חוקי ואינו פוגע באוכלוסיות מוגנות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗