GPT
W

Wan2.2-Distill-Loras

קוד פתוח

lightx2vapache-2.02025-10-16

  • diffusers
  • diffusion-single-file
  • comfyui
  • distillation
  • LoRA

משקולות LoRA שמקצרות את יצירת הווידאו מתמונה ל־4 צעדים בלבד על בסיס Wan2.2. פתרון ממוקד למי שרוצה להריץ מודל וידאו כבד בפחות זמן עיבוד בלי להחליף את כל קובצי המקור.

  • 2.4 GBמשקל הקבצים
  • 123,399הורדות בחודש
  • 285לייקים

מה זה

המאגר הזה מחזיק משקולות LoRA ברמת Rank 64 שחולצו ממודלים מזוקקים של Wan2.2 עבור משימת תמונה לווידאו (I2V). במקום להריץ עשרות צעדי דיפיוזיה ארוכים שדורשים זמני המתנה כבדים, המשקולות האלו דוחסות את תהליך ההסקה ל־4 צעדים דרך רשימת הסרת רעש מוגדרת מראש (1000, 750, 500 ו־250).

החלוקה כאן מתבססת על שתי רמות רעש שונות בפורמט safetensors. גרסת הרעש הגבוה מכוונת לתנועה חופשית ומגוונת יותר של הווידאו, בעוד גרסת הרעש הנמוך שומרת באדיקות על תמונת המקור ומייצרת תוצאה יציבה. הרעיון הוא לתת גמישות: לא צריך להוריד מודל מזוקק שלם בגודל עשרות גיגהבייט אם כבר יש לכם את מודל הבסיס של Wan2.2.

מתאים ל

  • רינדור וידאו מהיר בתחנות מקומיות

    קיצור זמן ההמתנה להסקה ל־4 צעדים בלבד בעבודה מקומית ב־ComfyUI על מודל Wan2.2.

  • שילוב בצינורות עיבוד עם FP8

    מיזוג מקדים לתוך מודל הבסיס יחד עם כימות, לטובת חיסכון בזיכרון והאצת קצב היצירה בשרתים.

  • הנפשת תמונות בהתאמה לתנועה

    מעבר גמיש בין רעש גבוה לרעש נמוך לפי הצורך בתנועה דרמטית או שמירה מדויקת על המקור.

איפה זה נופל

זה לא פתרון קסם שעובד ישר מהקופסה. נקודת התורפה המרכזית היא התלות המוחלטת במודל הבסיס וברכיבים חיצוניים שבלעדיהם שום דבר לא עובד. מעבר לזה, דחיסה של הסקה ל־4 צעדים מועדת לעיוותים גרפיים או אובדן פרטים עדינים בתנועה לעומת הרצה מלאה ואטית. צריך גם לשים לב לרמת הרעש שבוחרים, כי שימוש לא נכון עלול לתת תנועה מוגזמת ולא קשורה או לחלופין סרטון כמעט קפוא.

שאלות
נפוצות

האם הקבצים במאגר הזה מספיקים כדי להתחיל לייצר וידאו?

לא. מדובר במשקולות LoRA בלבד ולא במודל עצמאי. כדי להפעיל אותן חובה להוריד בנפרד את מודל הבסיס Wan2.2-I2V-A14B, ובנוסף רכיבי תשתית הכרחיים: T5, מקודד CLIP ו־VAE.

באיזה קובץ עדיף לבחור, ברעש הגבוה או ברעש הנמוך?

זה תלוי בתוצאה המבוקשת. קובץ ה־high noise מתאים ליצירה חופשית יותר עם תנועה דינמית ומשמעותית, בעוד קובץ ה־low noise מתאים למי שרוצה וידאו יציב שנשאר צמוד מאוד לתמונת הקלט.

איך מריצים

המשקולות שוקלות 2.4 גיגהבייט בלבד, אבל אי אפשר להריץ אותן לבד. הן תוסף למודל הבסיס Wan2.2-I2V-A14B, כך שבפועל מדובר על הרצת מודל של 14 מיליארד פרמטרים. צריך כרטיס מסך חזק מאוד עם נפח זיכרון מכובד, במיוחד אם לא משתמשים בכימות. אפשר למזג את ה־LoRA מראש לתוך המודל עם כימות FP8 כדי לחסוך מקום בזמן ריצה, או לטעון אותן דינמית דרך LightX2V או ComfyUI.

בנוסף למשקולות הבסיס וה־LoRA, חייבים להחזיק מקומית מפענחי טקסט ווידאו משלימים: מקודד T5, מקודד ראייה CLIP ורכיבי VAE. אם אין לכם תשתית מקומית מתאימה להרצת מודלי 14B, עדיף להשתמש ב־API מנוהל.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("lightx2v/Wan2.2-Distill-Loras")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש במשקולות לצרכים מסחריים, לשנות, למזג לתוך מודלים אחרים ולהפיץ הלאה בחינם או בתשלום. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗