GPT
A

Autoencoders

קוד פתוח

lightx2vapache-2.02025-10-17

  • diffusers
  • diffusion-single-file
  • comfyui
  • distillation
  • LoRA

אוסף מקודדים ומפענחים חסכוניים בווידאו למשפחת Wan, שחותכים בחצי את צריכת הזיכרון ומקצרים זמני פענוח כבדים.

  • 6.6 GBמשקל הקבצים
  • 5,370הורדות בחודש
  • 130לייקים

מה זה

המאגר הזה מאגד מודלי Autoencoder מכווצים שמיועדים לעבודה מול מודלי הווידאו Wan2.1 ו־Wan2.2. במודלי וידאו מבוססי דיפוזיה, שלבי הקידוד והפענוח של ה־VAE הם צוואר בקבוק כבד של זיכרון וזמן. המאגר מכיל את הגרסאות הרשמיות של Wan, לצד חלופות קלות משני סוגים: משפחת LightVAE שעברה גיזום של 75 אחוז ואיזוק, ומשפחת LightTAE שמבוססת על ארכיטקטורת Conv2D קלה.

בבדיקות שנעשו על סרטון של 5 שניות ו־81 פריימים על גבי NVIDIA H100 בפורמט BF16, המודל הרשמי של Wan2.1 דרש 10.1287 ג׳יגה זיכרון לצורך פענוח ולקח 5.4649 שניות. לעומתו, lightvaew2_1 ירד ל־5.5673 ג׳יגה זיכרון ולזמן של 2.0697 שניות. גרסאות ה־LightTAE מקצצות את צריכת הזיכרון בפענוח ל־0.41199 ג׳יגה בלבד וזמן ריצה של 0.2463 שניות, תוך ויתור מסוים על איכות ביחס למודל התלת-ממדי הרשמי.

מתאים ל

  • הסקה מקומית ב־ComfyUI

    מאפשר לייצר וידאו בכרטיסי מסך ביתיים בלי לקבל שגיאות חוסר זיכרון בשלב הפענוח הסופי.

  • בדיקות ואיטרציות מהירות

    דגמי LightTAE מקצרים את שלב השחזור לשברירי שנייה ומאפשרים לבחון רעיונות במהירות.

  • הפקת וידאו בתקציב מחשוב מוגבל

    גרסת lightvaew2_1 מציעה איכות תלת-ממדית גבוהה בחצי מכמות הזיכרון של המודל הרשמי.

איפה זה נופל

הגרסאות המכווצות לא מגיעות לאיכות השחזור המושלמת של המודלים הרשמיים, ובדגמי ה־LightTAE מבוססי הדו-ממד יש אובדן פרטים מסוים. בנוסף, חל איסור מוחלט לערבב גרסאות: מודל VAE של Wan2.1 יעבוד אך ורק מול מודל בסיס של Wan2.1, ומודל של Wan2.2 מתאים אך ורק לסדרת 2.2. קוד האימון והזיכוך עדיין מסומן כמשימה פתוחה ולא שוחרר במאגר.

שאלות
נפוצות

מה עדיף לי, LightVAE או LightTAE?

אם המטרה היא איכות וידאו סופית ומדויקת, LightVAE עדיף כי הוא שומר על שכבות Causal Conv3D כמו המודל המקורי. אם אתם סובלים ממחסור חמור בזיכרון או צריכים תצוגה מקדימה מהירה, LightTAE יספק ביצועים מהירים בהרבה עם צריכת זיכרון זניחה של כ־0.4 ג׳יגה.

האם אפשר להשתמש במפענח של Wan2.1 עם מודל בסיס של Wan2.2?

לא. הארכיטקטורות והמרחבים החבויים אינם תואמים. שימוש ב־VAE של גרסה אחת על מודל בסיס מגרסה אחרת יוביל לפלט שגוי ומקולקל.

איך מריצים

מורידים את הקבצים במשקל כולל של 6.6 ג׳יגה דרך huggingface-cli או ישירות מול diffusers ומאגר הקוד של LightX2V בגיטהאב. הריצה מתבצעת בכרטיסי מסך תומכי CUDA בפורמט bfloat16, כאשר יש תמיכה ישירה בסקריפטים עצמאיים של שחזור וידאו, בסקריפטי ההסקה של LightX2V וגם בתוסף ייעודי ל־ComfyUI.

מבחינת חומרה, המודלים הרשמיים דורשים כרטיס עם לפחות 12 עד 16 ג׳יגה VRAM רק לפענוח. אם אתם עובדים על כרטיסים צנועים יותר או צריכים לשלב את ה־VAE באותו כרטיס עם מודל הדיפוזיה הראשי, lightvaew2_1 מסתפק בכ־6 ג׳יגה, וגרסאות ה־LightTAE רצות בקלות על כרטיסי מסך ביתיים כמעט ללא צריכת זיכרון.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("lightx2v/Autoencoders")
img = pipe("a photo").images[0]

הרישיון

רישיון apache-2.0 חופשי ומתיר שימוש מסחרי, שינוי קוד והפצה. אפשר לשלב את המשקולות במוצר סגור או שירות ענן ללא תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗