GPT
W

Wan2.1-I2V-14B-480P

קוד פתוח

Wan-AIapache-2.02025-02-25

  • diffusers
  • safetensors
  • i2v
  • video
  • video-generation

הופך תמונה יחידה לווידאו ברזולוציית 480P באמצעות שילוב הנחיית טקסט. המודל מתאים למי שרוצה וידאו מקומי בקוד פתוח עם הפקה אמינה של טקסט באנגלית ובסינית.

  • 16Bפרמטרים
  • 76.6 GBמשקל הקבצים
  • 47,181הורדות בחודש
  • 233לייקים

מה זה

מדובר במודל Image-to-Video מבוסס Diffusion Transformer שרץ על ארכיטקטורת Flow Matching עם קידוד טקסט מבוסס T5. הוא מקבל תמונה והנחיית טקסט, ומייצר מתוכן סרטון מונפש ששומר על יחס הגובה והרוחב של הקלט המקורי. הדגש כאן הוא על מהירות ביחס לאיכות, כאשר התוצר מוגבל מראש לרזולוציית 480P במקום 720P שקיימת בגרסה נפרדת.

הייחוד הטכני הבולט שלו לעומת חלופות פתוחות הוא Wan-VAE, מקודד תלת ממדי סיבתי שמטפל ברצף הזמן בלי לאבד מידע היסטורי. בנוסף, הוא כולל תמיכה מובנית ביצירת טקסט ויזואלי ברור בתוך הווידאו עצמו באנגלית ובסינית, תחום שבו רוב מודלי הווידאו הפתוחים נכשלים לחלוטין ומייצרים מריחות בלתי קריאות.

מתאים ל

  • הנפשת תמונות מוצר

    יצירת סרטוני תנועה קצרים ומהירים מתוך תמונות סטילס, ברזולוציה שמתאימה לתצוגה מקדימה ברשת.

  • שילוב טיפוגרפיה בווידאו

    הנפשת גרפיקה שכוללת שלטים או טקסט באנגלית ובסינית, בזכות תמיכה מובנית ברינדור אותיות ברורות.

  • פייפליין מקומי מבוזר

    הפקת וידאו בכמויות על גבי שרתי לינוקס פנימיים עם 8 כרטיסי מסך באמצעות תמיכה מובנית ב־FSDP.

איפה זה נופל

המגבלה המרכזית היא הרזולוציה, המודל הזה נעול ל־480P בלבד ולא יודע להוציא 720P בצורה יציבה, לשם כך צריך להוריד משקלים נפרדים לגמרי. בנוסף, כדי לקבל תוצאות מדויקות מהנחיות קצרות צריך להפעיל שלב הרחבת פרומפטים שדורש מודל שפה נוסף כמו Qwen2.5-VL או קריאה לשירות חיצוני. בעברית אין תמיכה מתועדת, והאינטגרציות הנוחות ל־Diffusers ול־ComfyUI עדיין סומנו כעבודה בתהליך ולא הושלמו בקוד המקורי.

שאלות
נפוצות

אפשר להריץ את המודל הזה על כרטיס מסך ביתי אחד?

זה אפשרי טכנית כי הסקריפט כולל אופציית פריקה למעבד, אבל מדובר במודל ששוקל מעל 76 גיגה בייט. על כרטיס ביתי פשוט התהליך יהיה איטי מאוד, ובניגוד לגרסת ה־1.3B שמסתפקת בכ־8 גיגה בייט זיכרון, כאן מדובר במפלצת שמכוונת לשרתים.

למה להוריד את גרסת ה־480P ולא ללכת ישר על ה־720P?

היתרון של ה־480P הוא זמני הפקה קצרים בהרבה ופחות עומס חישובי. אם אתם צריכים לייצר כמויות של תצוגות מקדימות, ניסויים מהירים או עיבודים קלים, הגרסה הזו חוסכת זמן ומשאבים לעומת גרסת ה־720P הכבדה.

האם המודל מבין פרומפטים בעברית?

לא. המודל מתעד תמיכה מפורשת באנגלית ובסינית בלבד, גם בטקסט שמופיע בתוך הווידאו וגם בפיענוח ההנחיות. אם תזינו עברית, התוצאה כנראה תהיה שגויה ועדיף לתרגם את הפרומפט לאנגלית מראש.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־76.6 גיגה בייט ב־33 קבצים שונים, כך שהרצה מקומית דורשת משאבים רציניים. אפשר להריץ אותו על כרטיס בודד בעזרת פריקת רכיבים לזיכרון הראשי עם הדגל offload_model, או לבזר אותו על קלאסטר של שמונה כרטיסים באמצעות שילוב של FSDP ו־xfuser. הקוד דורש PyTorch מגרסה 2.4.0 ומעלה.

אם אתם צריכים רק הדמיה אחת מדי פעם ואין לכם שרת ייעודי עם שפע זיכרון גרפי, עדיף להשתמש ב־API כמו DashScope שנתמך בסקריפטים של המאגר. הרצה עצמית שווה את המאמץ רק כשיש לכם חומרה ייעודית וצורך בהרצת כמויות גדולות מאחורי פיירוול ארגוני.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Wan-AI/Wan2.1-I2V-14B-480P")
img = pipe("a photo").images[0]

הרישיון

הפצה תחת רישיון Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים את נוסח הרישיון. היוצרים מבהירים שאין להם שום בעלות על התוכן שתייצרו, והאחריות המשפטית המלאה על השימושים חלה עליכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗