GPT
L

LTX-Video

קוד פתוח

Lightricksother2024-10-31

  • diffusers
  • safetensors
  • ltx-video
  • image-to-video
  • en

מודל מבוסס DiT שמייצר וידאו מתמונה בזמן אמת, בקצב של 30 פריימים לשנייה וברזולוציה של 1216×704, מהר יותר מזמן הצפייה עצמו.

  • 1.9Bפרמטרים
  • 237 GBמשקל הקבצים
  • 595,064הורדות בחודש
  • 2,292לייקים

מה זה

הארכיטקטורה כאן נשענת על Diffusion Transformer ומכוונת לפתור את צוואר הבקבוק המרכזי של יצירת וידאו, מהירות הרינדור. במקום להמתין דקות ארוכות לכל שבריר תנועה, המודל מרנדר 30 פריימים בשנייה ברזולוציה של 1216 על 704 נקודות, בקצב שמקדים את זמן הניגון בפועל. האימון נעשה על מאגר רחב של סרטונים במטרה לייצר תנועה טבעית ומגוונת מתוך תמונת בסיס והנחיית טקסט.

המשפחה כוללת גרסאות שונות שנמתחות בין מודל קל של כ־2 מיליארד פרמטרים לגרסאות 13 מיליארד פרמטרים כבדות יותר, לצד גרסאות מזוקקות ומכוונות קוונטיזציה. בגרסת ה־2B המזוקקת הוסרו שלבי ה־STG וה־CFG, מה שמאפשר זינוק של פי 15 במהירות לעומת הרצה רגילה. התוצאה היא כלי שמסוגל לספק משוב ויזואלי מיידי לפיתוח ובדיקות, גם כשהתקציב החישובי מוגבל.

מתאים ל

  • הנפשת תמונות בזמן אמת

    מתאים למערכות שדורשות המרת תמונות סטילס לווידאו בקצב של 30 פריימים לשנייה ללא זמני המתנה ממושכים.

  • עבודה בתחנות קצה ו־ComfyUI

    גרסאות ה־2B וגרסאות ה־FP8 מתאימות למפתחים ויוצרים שרוצים להריץ תהליכי עבודה מקומיים בזיכרון VRAM מוגבל.

  • יצירת וידאו מרובה התניות

    תמיכה מובנית בחיבור מספר תמונות וקטעי וידאו קצרים לאורך ציר הזמן לייצור סצנה רציפה אחת.

איפה זה נופל

בצד החסרונות, המודל מוגבל מאוד בהבנת עובדות ואינו מיועד לייצג מידע מדויק. הכרטיס מודה במפורש כי הוא עלול להגביר הטיות חברתיות שקיימות בנתוני האימון. בעיה משמעותית נוספת היא היענות להנחיות, המודל מתקשה לעיתים קרובות להיצמד לפרומפט, ורמת הדיוק תלויה באופן כבד בסגנון הכתיבה. הטקסט חייב להיכתב באנגלית מפורטת וארוכה מאוד, אחרת התוצאה לא תתאים לדרישות. יש גם מגבלות טכניות קשיחות, הרזולוציה חייבת להתחלק ב־32 ומספר הפריימים חייב להיות כפולה של שמונה ועוד אחד, כאשר מעבר ל־257 פריימים או רזולוציה של 720 על 1280 איכות התוצר יורדת.

שאלות
נפוצות

איזה פרומפט צריך לכתוב כדי לקבל תוצאה טובה?

המודל מבין אנגלית בלבד ודורש תיאורים עשירים וארוכים מאוד. כדאי לפרט את תנאי התאורה, הרקע, סוג התנועה והפרטים הקטנים בסצנה. הנחיות קצרות וכלליות יובילו לחוסר התאמה בין הטקסט לתוצאה הוויזואלית.

מה המשמעות של מגבלות הרזולוציה ומספר הפריימים?

הארכיטקטורה דורשת ממדים שמתחלקים ב־32 וכמות פריימים של כפולה של שמונה ועוד אחד, למשל 257 פריימים. אם תזינו מידות אחרות, המערכת תבצע ריפוד וחיתוך אוטומטיים, אך מעבר לטווח המומלץ האיכות תיפגע.

האם כדאי להריץ את גרסת ה־13B או להסתפק ב־2B?

גרסת 13B נותנת איכות גבוהה יותר אך דורשת משאבי זיכרון וידאו כבדים. אם אתם זקוקים למהירות מקסימלית או מריצים על חומרה מקומית סטנדרטית, גרסת 2B המזוקקת מספקת ביצועים מהירים משמעותית עם ירידה קלה בלבד באיכות.

איך מריצים

להרצה מקומית תצטרכו סביבת לינוקס עם Python 3.10.5, גרסת CUDA 12.2 וספריית PyTorch 2.1.2 ומעלה. המשקל הכולל של הקבצים במאגר עצום, 237 גיגה־בייט המחולקים לעשרות קבצים, כך שצריך לוודא שיש מספיק נפח אחסון פנוי. יש תמיכה ישירה בספריית diffusers של Hugging Face ובסביבת ComfyUI עם תהליכי עבודה מוכנים מראש.

בחירת המשקולות קובעת את דרישות החומרה. אם אין לכם כרטיסי מסך חזקים עם זיכרון VRAM נרחב עבור גרסאות ה־13B, גרסאות ה־FP8 המכווצות או דגמי ה־2B יאפשרו לרוץ על חומרה צנועה בהרבה. למי שאינו מעוניין להחזיק תשתית GPU ייעודית, המודל זמין ישירות דרך שירותי ענן כמו Fal.ai, Replicate ו־LTX-Studio.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Lightricks/LTX-Video")
img = pipe("a photo").images[0]

הקבצים

63 קבצים במאגר, 237 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ואינו רישיון קוד פתוח סטנדרטי. לכל גרסה ורכיב במאגר מוצמד קובץ תנאים ייעודי תחת השם Open Weights License או רישיונות גרסה ספציפיים של Lightricks. מי שמתכנן להטמיע את המודל במוצר מסחרי חייב לקרוא את קובצי הרישיון הפרטניים במאגר כדי לוודא עמידה במגבלות השימוש המסחרי וההפצה.

הרישיון המלא בעמוד המודל ↗