GPT
W

Wan2.2-Distill-Models

קוד פתוח

lightx2vapache-2.02025-10-16

  • diffusers
  • safetensors
  • i2v
  • diffusion-single-file
  • comfyui

גרסה מזוקקת של מודל הווידאו Wan2.2 שמייצרת סרטונים בארבעה צעדים במקום עשרות. היא חוסכת זמן חישוב יקר ומאפשרת ליצור וידאו כמעט בזמן אמת.

  • 368 GBמשקל הקבצים
  • 32,399הורדות בחודש
  • 144לייקים

מה זה

הפרויקט מכיל משקלים מזוקקים של Wan2.2 בגודל 14 מיליארד פרמטרים, המיועדים למשימות תמונה לווידאו וטקסט לווידאו. הרעיון המרכזי כאן הוא צמצום תהליך הדגימה המסורתי, שדורש לרוב מעל 50 צעדים, ל־4 צעדים בלבד. זה מקצץ את זמני הרינדור באופן דרמטי בלי למחוק את איכות התמונה לחלוטין.

הריפו מציע חלוקה לרמות רעש שונות בכל משימה. גרסאות הרעש הגבוה נותנות למודל חופש יצירתי ומגוון תנועתי רחב יותר, בעוד גרסאות הרעש הנמוך שומרות על יציבות ונאמנות גבוהה לקלט המקורי. יש כאן גם גרסאות 720p שאומנו על דאטה ייעודי כדי לחדד טקסטורות ופרטים קטנים.

מתאים ל

  • הנפשת תמונות סטילס

    מודל תמונה לווידאו ברעש נמוך מאפשר להפיק אנימציות עדינות שנאמנות מאוד לתמונת המקור.

  • יצירת וידאו על כרטיס יחיד

    משקלי FP8 ו־INT8 מאפשרים להפיק וידאו מבוסס 14B על חומרת צרכנים עם 24 גיגה זיכרון.

  • פייפליין מהיר לבדיקת רעיונות

    הסקה ב־4 צעדים חותכת את זמן ההמתנה ומאפשרת לבחון במהירות הנחיות טקסט שונות.

איפה זה נופל

הקבצים בריפו כוללים רק את משקלי ה־DIT של המודל. הם לא יעבדו עצמאית מהקופסה עד שלא תורידו ותגדירו ידנית רכיבים נוספים: מקודד טקסט T5, מקודד ראייה CLIP, מפענח ומקודד VAE וטוקנייזר. בנוסף, זיקוק לארבעה צעדים גובה מחיר בלתי נמנע ביציבות התנועה ובדיוק בהשוואה להרצה מלאה וארוכה. אל תצפו לאותה רמת עקביות בפרטים מורכבים.

שאלות
נפוצות

האם צריך להוריד את כל 368 הגיגה בייט כדי להריץ וידאו?

ממש לא. הנפח העצום נובע מכך שהמאגר מאחסן עשרות וריאציות של אותו המודל ברמות דיוק שונות. בפועל מורידים רק קובץ safetensors יחיד בגודל 15 עד 28.6 גיגה בייט לפי כרטיס המסך שלכם.

האם המודל מוכן לעבודה ישירות דרך diffusers?

הכרטיס מקשר ישירות לתשתית LightX2V ומציע גם זרימת עבודה ל־ComfyUI. בנוסף חובה להוריד בנפרד מקודדי T5, CLIP ו־VAE, כך שנדרשת עבודת אינטגרציה ולא פקודת טעינה בודדת.

איך מריצים

משקל הריפו כולו עומד על 368 גיגה בייט בגלל עשרות קבצים וגרסאות, אבל בפועל מורידים רק קובץ בודד שמתאים למשימה. קובץ BF16 שוקל כ־28.6 גיגה בייט ודורש מאיץ ברמת A100 או H100 עם 80 גיגה זיכרון. לכרטיסי 24 גיגה כמו RTX 4090 צריך להוריד את גרסאות ה־FP8 או INT8 ששוקלות כ־15 גיגה בייט, ולהשתמש בהגדרות פריקה לזיכרון המערכת.

ההרצה מתבצעת בעיקר דרך תשתית LightX2V בגיטהאב שמציגה ביצועים כפולים במהירות לעומת ComfyUI, אם כי יש גם קובצי תאימות ל־ComfyUI. אם אין ברשותכם כרטיס עם לפחות 24 גיגה זיכרון גרפי ייעודי, אין טעם לנסות להריץ מקומית ותצטרכו לשכור שרת ענן מתאים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("lightx2v/Wan2.2-Distill-Models")
img = pipe("a photo").images[0]

הקבצים

186 קבצים במאגר, 368 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, והפצה מחדש. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים וצירוף עותק של הרישיון המקורי בכל הפצה של התוכנה או תוצריה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗