GPT
W

Wan2.2-I2V-A14B

קוד פתוח

Wan-AIapache-2.02025-07-24

  • wan2.2
  • diffusers
  • safetensors
  • image-to-video
  • en

המודל הופך תמונת סטילס לווידאו בתנועה יציבה באמצעות ארכיטקטורת מומחים. בוחרים בו כשרוצים איכות ויזואלית ברמת 720P בלי תנועות מצלמה מופרכות, ושיש חומרה מתאימה להריץ משקל כזה.

  • 118 GBמשקל הקבצים
  • 10,403הורדות בחודש
  • 798לייקים

מה זה

מדובר במודל image-to-video שמייצר וידאו ברזולוציות 480P ו־720P מתוך תמונה קיימת והנחיית טקסט, או מתמונה בלבד בעזרת הרחבת פרומפטים. המבנה שלו מבוסס על תערובת מומחים עם שני מודלים שונים בגודל 14 מיליארד פרמטרים כל אחד, כך שבסך הכל הוא מכיל 27 מיליארד פרמטרים, אבל מפעיל רק מומחה אחד בכל צעד של הסרת הרעש. מומחה אחד אחראי על שלבי הרעש הגבוהים שקובעים את המבנה והקומפוזיציה הכללית, והשני נכנס לפעולה כשרמת הרעש יורדת מתחת לסף מוגדר כדי לחדד פרטים.

האימון נעשה על נפח מידע מורחב של תמונות ווידאו בהשוואה לגרסה הקודמת, עם דגש על תיוג מדויק של תאורה, קומפוזיציה וצבעים. המודל מתמקד בריסון תנועות מצלמה מלאכותיות ובשמירה על סגנון אחיד לאורך הפריימים, כשהוא תומך בפרומפטים באנגלית ובסינית, ומשתלב ישירות בספריות Diffusers ו־ComfyUI לצד קוד ההרצה הרשמי.

מתאים ל

  • הנפשת תמונות סטילס לפרסום

    הפיכת צילומי מוצר סטטיים לסרטוני וידאו קצרים ברזולוציית 720P עם תנועת מצלמה יציבה ושליטה על תאורה וקומפוזיציה.

  • צינורות עיבוד וידאו בשרתים

    הטמעה ישירה בסביבות עבודה כמו ComfyUI ו־Diffusers על גבי חוות שרתי 80GB VRAM ליצירת וידאו מבוסס תמונה ללא מגע יד.

  • הנפשת סצנות עשירות ומסוגננות

    שימוש במומחי הרינדור הנפרדים לקבלת תנועות מורכבות ושמירה על סגנון אסתטי מוגדר מתוך תמונת מקור בודדת.

איפה זה נופל

החיסרון הבולט הוא דרישות החומרה הקיצוניות, כשהרצה על מעבד גרפי יחיד מחייבת חומרה ארגונית של 80 גיגה בייט זיכרון ומעלה. בנוסף, התמיכה בשפות מוגבלת רשמית לאנגלית וסינית בלבד, כך שהזנת הנחיות בעברית לא נתמכת ישירות בקלט. הפלט מוגבל לרזולוציית מקסימום של 720P, והמודל דורש התאמה של יחס התצוגה לפי תמונת המקור בלבד.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על כרטיס מסך ביתי מסדרת RTX?

לא. גרסת ה־A14B מחייבת כרטיס עם לפחות 80 גיגה בייט זיכרון גרפי בגלל גודל המודל ששוקל 118 גיגה בייט. לשימוש ביתי על גבי כרטיסי מסך צרכניים פותחה גרסת ה־5B שתומכת במשאבים נמוכים יותר.

איך עובדת שיטת ה־MoE בתהליך יצירת הווידאו כאן?

המודל מכיל שני מומחים של 14 מיליארד פרמטרים. מומחה הרעש הגבוה פעיל בשלבים הראשונים לקביעת מבנה התנועה, והמערכת עוברת אוטומטית למומחה הרעש הנמוך כשיחס האות לרעש יורד, לצורך השלמת פרטים עדינים.

האם חייבים להזין תיאור טקסטואלי יחד עם התמונה?

לא חובה. הקוד מאפשר להזין תמונה בלבד ולשלב מנגנון הרחבת פרומפטים שגוזר את התיאור ישירות מהתמונה כדי לכוון את יצירת התנועה.

איך מריצים

כדי להריץ את המודל על כרטיס בודד דרוש מאיץ עם לפחות 80 גיגה בייט של זיכרון גרפי, תוך שימוש בדגלי פריקה מהזיכרון והמרת טיפוסי משתנים. מדובר במשקל הורדה כולל של 118 גיגה בייט שמחולק לעשרות קבצים, כך שכרטיסי מסך ביתיים רגילים פשוט לא מחזיקים אותו.

בסביבות ייצור מרובות כרטיסים ההרצה דורשת חלוקה מבוזרת עם FSDP ו־DeepSpeed Ulysses על פני ארבעה או שמונה מעבדים גרפיים תומכי ארכיטקטורת Hopper ו־FlashAttention. אם אין לכם גישה לאשכול שרתים ייעודי עם נפחי זיכרון כאלה, הרצה מקומית של הגרסה הזו לא משתלמת, ועדיף לבחור בגרסת 5B הקלה יותר או לפנות לתשתית ענן מנוהלת.

pip install -U huggingface_hub
hf download Wan-AI/Wan2.2-I2V-A14B

הקבצים

33 קבצים במאגר, 118 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשנות אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על תנאי הרישיון וזכויות היוצרים המקוריות. היוצרים מצהירים שאין להם זכויות על התוכן המיוצר, אך חל איסור מפורש להשתמש בו להפצת מידע כוזב או לפגיעה באוכלוסיות לפי תנאי השימוש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗