GPT
W

Wan2.2-TI2V-5B

קוד פתוח

Wan-AIapache-2.02025-07-18

  • wan2.2
  • diffusers
  • safetensors
  • ti2v
  • text-to-video

מודל פתוח שמייצר וידאו מטקסט או מתמונה ברזולוציית 720p ובקצב של 24 פריימים לשנייה. הוא תוכנן לעבוד על כרטיס מסך ביתי יחיד בלי שצריך מערך שרתים ייעודי.

  • 31.9 GBמשקל הקבצים
  • 12,918הורדות בחודש
  • 771לייקים

מה זה

המודל הזה משלב יצירת וידאו מטקסט ומתמונה בתוך רשת אחת של חמישה מיליארד פרמטרים. בניגוד לגרסאות ה־MoE הגדולות של אותה סדרה שדורשות פיצול מורכב בין מודלים שונים, מדובר במודל דחוס שמתמקד ביעילות חישובית. הדגש העיקרי כאן הוא רכיב ה־VAE שמכווץ את המידע ביחס של 16 על 16 במרחב ופי 4 בזמן, מה שמוריד את העומס החישובי ומאפשר יצירה של קטעי וידאו חלקים יחסית.

האימון נעשה על נפח דאטה גדול משמעותית מהגרסה הקודמת, עם עלייה של 65.6 אחוזים בתמונות ו־83.2 אחוזים בווידאו, לצד תיוג מפורט של תאורה וקומפוזיציה. התוצאה היא שליטה טובה יותר בסגנון ובתנועה בהשוואה למודלים פתוחים ישנים יותר, כשהפלט מגיע כברירת מחדל ב־24 פריימים לשנייה ולא בקצבים המקוטעים שנפוצים בקטגוריה הזו.

מתאים ל

  • הנפשת תמונות סטילס

    הפיכת עיצובי קונספט או צילומים לסרטונים קצרים של 720p בלי צורך בשרתים מרובי כרטיסים.

  • פיתוח כלי וידאו מקומיים

    הטמעה בפרויקטים פנימיים או ביישומי ComfyUI הדורשים ריצה עצמאית על חומרת צרכנים.

  • מחקר גנרטיבי

    בדיקת ארכיטקטורות דחיסת וידאו ויחסי VAE קיצוניים על מודל פתוח שאינו מפוצל למומחים.

איפה זה נופל

למרות שהוא נכנס ב־RTX 4090, יצירת חמש שניות של וידאו דורשת קרוב לתשע דקות שלמות, מה שהופך שימוש בזמן אמת לבלתי אפשרי. מעבר לזה, רזולוציית ה־720p שלו נעולה ל־1280 על 704 פיקסלים במקום 720 פיקסלים סטנדרטיים, מה שמחייב התאמות בקוד אם אתם משלבים אותו בפייפליין קיים. המודל גם תומך רשמית באנגלית ובסינית בלבד, כך שהזנת הנחיות בעברית לא תפיק תוצאות עקביות.

שאלות
נפוצות

האם המודל מבין עברית?

לא. המודל אומן ותומך רשמית רק באנגלית ובסינית. כדי להשתמש בו בפרויקט בעברית תצטרכו לתרגם את ההנחיות לפני השליחה למודל.

האם חובה כרטיס מסך עם 80 גיגה זיכרון?

לא, אפשר להריץ אותו על כרטיס של 24 גיגה כמו RTX 4090. עם זאת, במצב כזה חייבים להפעיל פריקה של חלק מהרכיבים ל־RAM ולמעבד הראשי, מה שמאט את הריצה לכמעט תשע דקות לסרטון קצר.

איך מריצים

כדי להריץ אותו על מחשב מקומי צריך כרטיס מסך עם לפחות 24 גיגה זיכרון, כמו RTX 4090. הפעלת ההסקה ברמת חומרה כזו דורשת שימוש בדגלים שפורקים את המודל לזיכרון הראשי ומעבירים את מעבד ה־T5 ל־CPU. יצירת סרטון של חמש שניות בתצורה הזו לוקחת קצת פחות מתשע דקות.

אם יש לכם גישה למעבדי שרתים עם 80 גיגה זיכרון, אפשר לוותר על הדגלים האלה ולקבל ביצועים מהירים בהרבה. בנוסף, הקוד תומך בהרצה מבוזרת על גבי שמונה מעבדים גרפיים באמצעות DeepSpeed Ulysses ו־FSDP.

pip install -U huggingface_hub
hf download Wan-AI/Wan2.2-TI2V-5B

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים המקורית ולא משתמשים בו לפעילות בלתי חוקית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗