GPT
W

Wan2.2-Lightning

קוד פתוח

lightx2vapache-2.02025-08-04

  • diffusers
  • safetensors
  • text-to-video;
  • image-to-video;
  • comfyUI;

גרסת זיקוק למשפחת יצירת הווידאו שמייצרת קטעים בארבעה צעדים בלבד. מתאים למי שחייב מהירות גבוהה פי 20 בלי להסתבך עם טריקים של הנחיית סיווג.

  • 39.2 GBמשקל הקבצים
  • 168הורדות בחודש
  • 630לייקים

מה זה

מדובר בגרסה מזוקקת של מודל הווידאו Wan2.2, שמיועדת למשימות טקסט לווידאו ותמונה לווידאו ברזולוציות של 480P ו־720P. השינוי המרכזי כאן מול מודלים רגילים בתחום הוא צמצום תהליך הדגימה לארבעה צעדים ללא צורך ב־CFG, מה שמספק האצה של פי 20 בזמן הריצה ושומר במקביל על דינמיקת תנועה מורכבת ואיכות ויזואלית שמשתווה למודל הבסיס.

הפרויקט כולל משקלי LoRA מדורגים עבור מודלי 14B, ומגיע עם תמיכה מובנית בתהליכי עבודה ב־ComfyUI. בנוסף, המערכת נשענת על מודלי שפה ממשפחת Qwen או שירות Dashscope כדי להרחיב את הפרומפטים שלכם לפני הרינדור, מה שמוסיף פרטים ומעלה את איכות התוצר הסופי.

מתאים ל

  • הנפשת תמונות סטילס

    הופך תמונות קיימות לקטעי וידאו קצרים ברזולוציה של עד 720P בארבעה צעדי דגימה מהירים בלבד.

  • יצירת וידאו מהירה מטקסט

    מייצר סצנות שלמות מתיאור מילולי באנגלית בדינמיקה מורכבת ובמהירות גבוהה פי 20 ממודל הבסיס.

  • שילוב בצינורות ComfyUI

    מתאים ליוצרים שעובדים עם ComfyUI ומחפשים תהליך עבודה מובנה ומוכן מראש למודל 14B מזוקק.

איפה זה נופל

בקטעים עם תנועה מהירה או קיצונית במיוחד, המודל מייצר עיוותים וארטיפקטים ברורים בעין. הכרטיס מציין במפורש שבמקרים מסוימים כיוון התנועה של כלי רכב עלול להתהפך לחלוטין. בנוסף, המודל תומך רק בשפה האנגלית, כך שפרומפטים בעברית ידרשו תרגום מראש, ואיכות התוצר תלויה מאוד במודל הרחבת הפרומפטים שמריצים לצידו.

שאלות
נפוצות

האם המודל יכול לרוץ על כרטיס מסך ביתי רגיל?

לא. המודל דורש GPU עם לפחות 80GB של VRAM כדי להריץ פקודה על כרטיס בודד. גם עם שימוש בדגלי פריקת זיכרון, חומרה צרכנית רגילה לא תצליח להחזיק אותו.

מה ההבדל בין גרסה V1 לגרסה V1.1 ביצירת טקסט לווידאו?

לפי נתוני הפרויקט, גרסה V1.1 מספקת איכות תמונה ותוצאה ויזואלית מעט טובה יותר לעומת גרסת V1 המקורית. שתיהן פועלות בתהליך של ארבעה צעדים על בסיס מודל ה־14B.

למה כדאי להפעיל את הרחבת הפרומפטים בזמן הריצה?

ההרחבה מוסיפה פרטים חיוניים לתיאור הראשוני ומעלה את איכות הווידאו שמתקבל. אפשר להשתמש במודל Qwen מקומי לפי גודל הזיכרון הפנוי, או לפנות ל־API של Dashscope כדי לחסוך משאבים מקומיים.

איך מריצים

כדי להריץ אותו על כרטיס בודד תצטרכו חומרה עם לפחות 80GB של VRAM, לצד הורדת מודל הבסיס הרשמי של Wan2.2 ושכבת ה־LoRA המזוקקת. אם הזיכרון נחנק, אפשר להשתמש בדגלים שמפנים את מודל השפה T5 למעבד המרכזי ומבצעים פריקה מהירה מהזיכרון הגרפי.

עבור עבודה רצינית יותר או סביבות בדיקה, ההרצה מתבצעת על אשכול של שמונה כרטיסים באמצעות DeepSpeed Ulysses ו־PyTorch FSDP. אם אין לכם גישה למעבדים גרפיים בנפח של 80GB, הפתרון היחיד הוא לפנות לספקי API חיצוניים, כי המודל הזה פשוט כבד מדי למחשבים אישיים רגילים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("lightx2v/Wan2.2-Lightning")
img = pipe("a photo").images[0]

הקבצים

24 קבצים במאגר, 39.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי והפצה של הקוד והמשקלים. היוצרים מבהירים שאין להם זכויות על התוכן שתייצרו, אך חלה עליכם אחריות מלאה לוודא שהשימוש אינו מפר חוק או פוגע באוכלוסיות שונות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗