GPT
W

Wan2.1-I2V-14B-480P-Diffusers

קוד פתוח

Wan-AIapache-2.02025-03-01

  • diffusers
  • safetensors
  • video
  • video-generation
  • image-to-video

המודל מייצר סרטוני וידאו קצרים מתמונות סטילס ומטקסט ברזולוציית 480P. הוא פונה למי שמחפש איכות תנועה גבוהה בקוד פתוח עם שילוב ישיר בספריית diffusers.

  • 16Bפרמטרים
  • 83.9 GBמשקל הקבצים
  • 87,573הורדות בחודש
  • 64לייקים

מה זה

מדובר במודל Diffusion Transformer ייעודי לתמונה לווידאו בקנה מידה של 16 מיליארד פרמטרים. הוא מקבל תמונה כבסיס ומייצר סרטון באורך קצר לפי הנחיית טקסט, תוך שמירה על יחס התמונה המקורי ברזולוציה של 832 על 480 פיקסלים. הארכיטקטורה משלבת מודל VAE תלת ממדי ייחודי לדחיסה זמנית לצד מקודד טקסט T5, מה שמעניק לו יכולת לייצר גם טקסט ויזואלי ברור באנגלית ובסינית בתוך הווידאו עצמו.

בניגוד למודלים סגורים, הגרסה הזו מגיעה כמשקלים גולמיים ומותאמת לספריית diffusers. במבחני הערכה פנימיים של המפתחים על פני 1,035 פרומפטים שונים, המודל עקף מודלים מסחריים ופתרונות קוד פתוח אחרים באיכות התנועה ובנאמנות לתמונת המקור. הגרסה הזו מתמקדת ברזולוציית 480P, שמאפשרת יצירה מהירה יותר על גבי חומרה מקומית בהשוואה לגרסת ה־720P הכבדה.

מתאים ל

  • הנפשת תמונות סטילס

    יצירת סרטוני תנועה קצרים מתמונות מוצר או פורטרטים לפי הנחיות טקסט מדויקות.

  • פיתוח פנימי ומחקר

    אינטגרציה ישירה לצנרות diffusers מקומיות וחקירת יכולות VAE מותאם לקוד פתוח.

  • שילוב כתוביות מובנות

    הפקת סרטונים הכוללים מילים באנגלית או בסינית ישירות מתוך המודל ללא עריכה גרפית.

איפה זה נופל

הרזולוציה מוגבלת ל־480P בלבד, ולכן התוצאה לא תתאים לתצוגה במסכים גדולים או להפקות שדורשות חדות גבוהה בלי מודל הגדלה נפרד. בנוסף, התמיכה בשפות מוגבלת לפי המפרט לאנגלית ולסינית בלבד, ללא תמיכה מובנית בטקסט בעברית.

המערכת אמנם מסוגלת לייצר אותיות בתוך הסרטון, אך היא עושה זאת באותיות לטיניות או סיניות בלבד. שילוב טקסט מקומי ידרוש עריכה חיצונית. המודל גם דורש זמן עיבוד ממושך ומשאבי זיכרון קיצוניים, ולכן הוא לא מתאים ליצירה בזמן אמת במוצר קצה.

שאלות
נפוצות

האם אפשר לייצר סרטונים ברזולוציה גבוהה מ־480P עם המודל הזה?

לא ישירות מהמשקלים האלה. המודל אומן ומיועד ליצירת וידאו ברזולוציית 480P בלבד, ועבור איכות של 720P תצטרכו להוריד את המשקלים הנפרדים של גרסת ה־720P.

האם כרטיס מסך ביתי אחד מספיק כדי לעבוד איתו?

הקבצים שוקלים כ־84 ג'יגה בייט ודורשים זיכרון גרפי עצום. כרטיס ביתי יחיד יתקשה מאוד להחזיק את המודל ללא פריקת רכיבים לזיכרון המחשב, מה שיאט את התהליך משמעותית, ולכן מומלץ לעבוד עם מערך מרובה מאיצים.

האם המודל מקבל הנחיות בעברית?

כרטיס המודל מצהיר על תמיכה באנגלית ובסינית בלבד דרך מקודד הטקסט T5. אם תזינו הנחיות בעברית, סביר להניח שהמודל לא יפרש אותן נכון, וכדאי לתרגם את הפרומפט לאנגלית לפני השליחה.

איך מריצים

המשקלים תופסים כמעט 84 ג'יגה בייט, כך שאי אפשר להריץ אותו על כרטיס ביתי פשוט בלי אופטימיזציה אגרסיבית. להרצה מקומית על כרטיס יחיד תצטרכו להפעיל פריקת מודל לזיכרון המערכת, או לחלופין לעבוד עם שרת של שמונה מאיצים גרפיים תוך שימוש ב־FSDP וספריית xfuser לחלוקת עומסים. חובה לוודא שמותקן PyTorch 2.4.0 ומעלה.

המפתחים מציעים גם שכבת הרחבת הנחיות בעזרת Qwen2.5-VL מקומי או פנייה ל־API חיצוני. אם אין לכם גישה לשרת ייעודי עם מאיצים מתאימים, הרצה של מודל בגודל כזה תהיה איטית מאוד, ובמצב כזה עדיף להשתמש ב־API מנוהל כדי להימנע מעלויות תשתית כבדות.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Wan-AI/Wan2.1-I2V-14B-480P-Diffusers")
img = pipe("a photo").images[0]

הקבצים

46 קבצים במאגר, 83.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המלא. אתם חופשיים להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים שלכם ללא תשלום תמלוגים. המפתחים מבהירים שאינם דורשים זכויות על התוכן המיוצר, אך אתם נושאים באחריות מלאה על חוקיות הסרטונים שמופקים ולא רשאים להשתמש בו לפגיעה, הפצת מידע כוזב או הפרת חוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗