GPT
W

Wan2.1-T2V-14B

קוד פתוח

Wan-AIapache-2.02025-02-25

  • diffusers
  • safetensors
  • t2v
  • video generation
  • text-to-video

המודל מייצר וידאו מטקסט באיכות גבוהה וברזולוציה של עד 720P. הוא פונה למי שמחפש תוצאות תנועה מתקדמות ויכולת נדירה לשלב טקסט באנגלית ובסינית בתוך הפריים.

  • 14Bפרמטרים
  • 64.3 GBמשקל הקבצים
  • 42,464הורדות בחודש
  • 1,556לייקים

מה זה

מדובר במודל Diffusion Transformer מבוסס Flow Matching שמיועד ליצירת וידאו מטקסט. המבנה שלו כולל מקודד T5 לצד 40 שכבות טרנספורמר עם 40 ראשי קשב, בנפח של 14 מיליארד פרמטרים. בנוסף שילבו כאן רכיב VAE תלת ממדי שמטרתו לשמר רצף זמני ולדחוס נתונים ביעילות. המערכת יודעת לייצר פלט ברזולוציות 480P וגם 720P, להבדיל מגרסת ה־1.3B שמיועדת רשמית רק ל־480P.

הייחוד הבולט מול מודלים אחרים הוא היכולת לייצר אותיות קריאות באנגלית ובסינית כחלק מהווידאו עצמו. המפתחים בחנו אותו מול 1,035 פרומפטים פנימיים וטוענים לביצועים מובילים על פני חלופות פתוחות וסגורות, אך חשוב לזכור שהבדיקה הזו נשענת על שקלול ציונים פנימי שמבוסס על העדפות אנושיות ולא על בנצ׳מרק חיצוני סטנדרטי בלתי תלוי.

מתאים ל

  • שילוב טיפוגרפיה בווידאו

    יצירת קליפים קצרים שדורשים הצגת טקסט וכתוביות קריאות באנגלית או בסינית ישירות מתוך הפרומפט.

  • הפקת תוכן שיווקי בתנועה

    יצירת סרטוני 720P עם תנועה דינמית ומורכבת מתיאור טקסטואלי מפורט.

  • מחקר גנרטיבי בקוד פתוח

    פיתוח כלי וידאו מותאמים אישית על בסיס ארכיטקטורת Diffusion Transformer גדולה וקוד חופשי.

איפה זה נופל

המודל תומך רק בשפות אנגלית וסינית, כך שפרומפטים בעברית לא יעבדו כלל. בנוסף, האיכות המרבית מוגבלת ל־720P בלבד, ללא תמיכה ישירה ביצירת 1080P. החיסרון המשמעותי ביותר בהרצה הוא התלות בהרחבת פרומפטים. המפתחים מציינים במפורש שהתוצאות הטובות תלויות בשלב מקדים שמרחיב את הטקסט דרך API חיצוני או מודל שפה נוסף, מה שמסבך את הפייפליין ומאט את זמן ההפקה הכולל.

אותה משפחה

Wan2.1-T2V יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס RTX 4090 יחיד?

הכרטיס מחזיק 24 גיגה בייט זיכרון, בעוד משקלי המודל לבדם מגיעים ל־64.3 גיגה בייט. הרצה מלאה של גרסת ה־14B דורשת שמונה מעבדים גרפיים. כדי לנסות להריץ על כרטיס בודד חובה להגדיר פריקה של המודל ושל מקודד ה־T5 אל זיכרון ה־CPU, מה שיאט משמעותית את קצב היצירה.

מה תפקידו של מנגנון הרחבת הפרומפטים שמופיע בהוראות?

המודל מפיק את התוצאות הטובות ביותר כשהטקסט עשיר ומפורט מאוד. לצורך כך המפתחים בנו שלב מקדים שמשתמש במודל שפה, מקומי או דרך ענן, כדי להרחיב את התיאור הראשוני לפני שליחתו למודל הווידאו.

איך מריצים

כדי להריץ אותו מקומית נדרשת חומרה כבדה מאוד. 27 קבצי המשקלים תופסים יחד 64.3 גיגה בייט, כך שכרטיס מסך בודד יתקשה לעמוד בעומס בלי לבצע פריקה לזיכרון הראשי. הקוד הרשמי תומך בהרצה על גבי שמונה מעבדים גרפיים במקביל בעזרת FSDP וספריית xfuser. מי שמנסה להריץ על מעבד גרפי יחיד מחויב להפעיל את דגלי offload_model ופריקת ה־T5 ל־CPU, אחרת ייתקל בשגיאות מחסור בזיכרון.

אם אין לכם קלאסטר שרתים ייעודי, הרצה מקומית תהיה אטית ומסורבלת, ובמיוחד אם תרצו לשלב את מנגנון הרחבת הפרומפטים שדורש מודל Qwen מקומי נוסף. במצב כזה, פנייה לפתרונות מנוהלים או ל־API חיצוני כמו Dashscope לצורך הרחבת הטקסט תחסוך את מרבית כאב הראש התפעולי.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Wan-AI/Wan2.1-T2V-14B")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל, לשנות אותו, להריץ אותו בענן ולשלב אותו במוצרים מסחריים בלי לשלם תמלוגים, ובתנאי שמצרפים את הרישיון המקורי. המפתחים מבהירים שאינם טוענים לזכויות על הסרטונים שנוצרים, אך מטילים על המשתמש את האחריות המלאה לוודא שהשימוש אינו פוגע באוכלוסיות מוחלשות, לא מפיץ מידע כוזב ולא מפר חוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗