GPT
W

Wan2.1-I2V-14B-720P-Diffusers

קוד פתוח

Wan-AIapache-2.02025-03-01

  • diffusers
  • safetensors
  • video
  • video genration
  • image-to-video

הופך תמונה יחידה לווידאו ברזולוציית 720P לפי הנחיית טקסט. שווה לבדוק אותו אם מחפשים מודל פתוח גדול להנפשת תמונות באיכות גבוהה ישירות דרך ספריית diffusers.

  • 16Bפרמטרים
  • 83.9 GBמשקל הקבצים
  • 98,525הורדות בחודש
  • 59לייקים

מה זה

הגרסה הזו מתמקדת במשימת תמונה לווידאו ומבוססת על ארכיטקטורת diffusion transformer עם flow matching. המודל כולל רכיב VAE תלת-ממדי שמבצע דחיסה במרחב ובזמן, ומשתמש במקודד T5 כדי לקרוא את הטקסט שמלווה את התמונה. הוא תומך בהנחיות באנגלית ובסינית, ויודע לשלב טקסט ויזואלי בתוך הווידאו עצמו בשתי השפות האלו.

לפי המפתחים, במבחני הערכה אנושית שכללו אלפי סבבים ו־1,035 פרומפטים על פני 14 ממדים שונים, הוא עקף מודלים פתוחים וסגורים קיימים. בפועל, החוזק שלו הוא ביצירת תנועה עקבית ששומרת על הפרטים של תמונת המקור ב־720P, מבלי לעוות את המבנה המקורי של הפריים לאורך שניות התנועה.

מתאים ל

  • הנפשת תמונות סטילס ב־720P

    לוקח תמונה בודדת ויוצר ממנה קטע וידאו איכותי בהתבסס על תיאור מילולי באנגלית או בסינית.

  • יצירת וידאו עם טיפוגרפיה

    מתאים לסרטונים שדורשים הופעת כתוביות וטקסט ויזואלי ברור באנגלית או בסינית בתוך הפריים.

  • הטמעה בפייפליין diffusers

    משתלב ישירות בפרויקטים מבוססי פייתון שכבר עובדים עם ספריות Hugging Face המוכרות.

איפה זה נופל

המשקל העצום, קרוב ל־84 גיגה-בייט, הופך את זמני הטעינה והריצה לצוואר בקבוק רציני בכל סביבת פיתוח מקומית. בנוסף, המודל הזה הוכשר ספציפית ל־720P ולא מיועד לרזולוציות נמוכות יותר כמו 480P, כך שאין כאן גמישות בביצועים על חשבון איכות. התמיכה בשפות מוגבלת לאנגלית ולסינית בלבד, והאינטגרציה עם סביבות עבודה נפוצות כמו ComfyUI עדיין מסומנת כלא גמורה בקוד המקור.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב אישי רגיל?

לא ממש. קבצי המודל שוקלים 83.9 גיגה-בייט ודורשים כרטיסי מסך חזקים מאוד עם זיכרון ייעודי גדול. המפתחים עצמם בודקים אותו עם חלוקה על פני שמונה כרטיסי מסך או עם טכניקות פריקת זיכרון כבדות לכרטיס יחיד.

האם אפשר לייצר בעזרתו וידאו ב־480P כדי לחסוך זמן ריצה?

הגרסה הספציפית הזו נבנתה ואומנה ל־720P בלבד. כדי להפיק וידאו ברזולוציית 480P צריך להוריד את המשקלים של מודל ה־480P הייעודי של אותה סדרה.

איך המודל מתמודד עם טקסטים בעברית?

הוא אינו תומך בעברית. המקודד ומערכות הטקסט הוכשרו על אנגלית וסינית בלבד, ולכן הנחיות או טקסט ויזואלי בעברית לא יעבדו בצורה תקינה.

איך מריצים

כדי להריץ אותו מקומית צריך להוריד 83.9 גיגה-בייט של משקלים. על כרטיס בודד חובה להפעיל פריקת זיכרון, וקוד המקור תומך בריצה מבוזרת על שמונה כרטיסי מסך בעזרת FSDP ו־xDiT לחלוקת העומס. דרישות הזיכרון גבוהות מאוד, כך שכרטיס ביתי פשוט לא יחזיק אותו בלי אופטימיזציות כבדות.

הגרסה הזו נעולה על רזולוציית 720P, ואם רוצים לרדת ל־480P צריך מודל נפרד מהסדרה. הקוד מאפשר להרחיב את הפרומפט בעזרת מודל ויז'ן מקומי או דרך קריאת API חיצונית, מה שמוסיף עוד דרישות חומרה אם מריצים הכל בשרת שלכם.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Wan-AI/Wan2.1-I2V-14B-720P-Diffusers")
img = pipe("a photo").images[0]

הקבצים

46 קבצים במאגר, 83.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא, מה שמאפשר שימוש מסחרי, שינוי הקוד והפצה של המודל בתוך מוצרים. היוצרים לא דורשים בעלות על התוכן שנוצר, אבל מחייבים עמידה בכללי הרישיון ואוסרים הפצה של תכנים פוגעניים, מידע כוזב או הפרת חוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗