GPT
H

Hy1.5-Quantized-Models

קוד פתוח

lightx2vapache-2.02025-11-21

  • diffusers
  • diffusion-single-file
  • comfyui
  • distillation
  • video

גרסה מכווצת של HunyuanVideo-1.5 שמורידה את צריכת הזיכרון בחצי, ומאפשרת לייצר וידאו באיכות 720p מטקסט או מתמונה על כרטיסי מסך ביתיים כמו RTX 4090.

  • 130 GBמשקל הקבצים
  • 1,229הורדות בחודש
  • 43לייקים

מה זה

מדובר במאגר משקלים שעברו קוונטיזציה לפורמט FP8-E4M3 עבור מודל הווידאו HunyuanVideo-1.5, כשהם מותאמים ישירות למסגרת הריצה LightX2V. במקום להחזיק משקלים כבדים בדיוק מלא, המודלים כאן משתמשים בקרנלים של SGLang או vLLM כדי לכווץ את דרישות ה־VRAM בשיעור של עד חמישים אחוז. החבילה מכילה מודלי DiT ייעודיים לייצור וידאו מתמונה ומווידאו מטקסט ברזולוציית 720p, יחד עם אנקודר טקסט מכווץ שמבוסס על Qwen2.5-VL.

ההבדל המשמעותי מול מודלי וידאו אחרים בנפח כזה הוא היכולת לחבר מודל פתוח חזק לחומרה שאינה שרת ארגוני יקר. במקום שתצטרכו שרשרת כרטיסי A100 כדי להפיק סרטונים קצרים באיכות גבוהה, הדחיסה מאפשרת להישאר קרוב מאוד לרמת התוצר המקורית בלי להקריב את מהירות ההסקה. זה שימושי בעיקר למי שרוצה לשלוט בכל תהליך הרינדור מקומית בלי לפתח תשתית אופטימיזציה מאפס.

מתאים ל

  • הנפשת תמונות סטילס ב־720p

    יצירת וידאו קצר מתוך תמונה קיימת ישירות על חומרה מקומית בעזרת מודל ה־I2V המכווץ.

  • מחולל וידאו מטקסט על 4090

    הפקת סרטונים מתיאורי טקסט בכרטיס עם 24GB זיכרון הודות לצמצום דרישות ה־VRAM.

  • הטמעה במוצרי וידאו מקומיים

    שילוב יכולות יצירת וידאו בשירותים פנימיים בלי להוציא נתונים החוצה ותחת רישיון פתוח.

איפה זה נופל

המשקלים המכווצים לא עובדים לבד. הם דורשים את משקלי המקור של HunyuanVideo-1.5 כבסיס, כך שעדיין תצטרכו לנהל את התלויות המקוריות ולא רק את הקבצים שכאן. בנוסף, יש תלות קשיחה בגרסאות תוכנה צרות, כולל דרישה ספציפית לקרנלים מתאימים של SGL או vLLM, מה שעלול ליצור התנגשויות בסביבות עבודה קיימות. הרזולוציה המובנית מוגבלת ל־720p, ולמרות שהדחיסה שומרת על איכות התמונה, ייתכנו ארטיפקטים בתנועות מהירות או בטקסטורות עדינות לעומת המודל המלא.

שאלות
נפוצות

האם אני חייב להוריד את כל 130 הג'יגה כדי לעבוד איתו?

לא. המאגר מכיל מודלים נפרדים לטקסט לווידאו, תמונה לווידאו ואנקודר טקסט. מומלץ להשתמש בסקריפט הורדה נקודתי של huggingface-hub ולהוריד רק את קובצי ה־safetensors שרלוונטיים לתהליך שלכם.

האם המודלים האלה רצים בצורה עצמאית לחלוטין?

לא. הקבצים כאן מחליפים רכיבים ספציפיים כמו ה־DiT והאנקודר, אבל הם נשענים על מבנה המודל המקורי של HunyuanVideo-1.5 ודורשים שילוב עם משקלי הבסיס דרך ספריית LightX2V.

איך מריצים

כדי להריץ את המודל תצטרכו להתקין את ספריית LightX2V מגיטהאב, יחד עם חבילת sgl-kernel שדורשת PyTorch 2.8.0, או לחלופין להשתמש בקרנלים של vLLM. מבחינת חומרה, כרטיס עם 24GB VRAM כמו RTX 4090 מספיק לעבודה הודות לדחיסה, ומומלץ להגדיר שימוש ב־SageAttention 2 כדי לקבל ביצועים מיטביים. חשוב לזכור שחובה להפעיל את פקודות הקוונטיזציה בקוד לפני יצירת הגנרטור עצמו, אחרת הן פשוט לא יפעלו.

שימו לב שהמאגר המלא שוקל 130GB בגלל ריבוי הקבצים, אבל בפועל אין צורך להוריד את כולו אלא רק את קובצי ה־safetensors הספציפיים למשימה שלכם, בין אם מדובר בטקסט לווידאו או תמונה לווידאו. אם אתם צריכים רק כמה סרטונים בודדים בחודש ואין לכם כרטיס עם 24GB זיכרון פנוי, עדיף לפנות ל־API חיצוני במקום להחזיק מכונה ייעודית שתעמוד ללא שימוש.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("lightx2v/Hy1.5-Quantized-Models")
img = pipe("a photo").images[0]

הרישיון

המודל משוחרר תחת רישיון Apache 2.0, בדיוק כמו המודל המקורי עליו הוא נשען. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות את הקוד ולהפיץ אותו הלאה, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי. אין כאן הגבלות מיוחדות על שילוב במוצר תוכנה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗