GPT
L

LTX-2.3-fp8

קוד פתוח

Lightricksother2026-03-05

  • diffusers
  • image-to-video
  • text-to-video
  • video-to-video
  • image-text-to-video

גרסת FP8 של מודל הווידאו מבית לייטריקס מייצרת וידאו עם סאונד מסונכרן מקובץ תמונה. הדיוק המוקטן נועד לאפשר הרצה מקומית בלי לרוקן את כל משאבי הזיכרון.

  • 54.6 GBמשקל הקבצים
  • 755,015הורדות בחודש
  • 136לייקים

מה זה

מדובר במודל מבוסס DiT שלוקח תמונת קלט ויוצר ממנה קטע וידאו יחד עם שמע מותאם באותו תהליך. העדכון הזה משפר את איכות התמונה, את הצליל ואת ההיענות להנחיות טקסט לעומת הדור הקודם. החבילה מכילה שתי גרסאות שונות, אחת מלאה שמתאימה גם להמשך אימון וגמישות מירבית, והשנייה מזוקקת שמיועדת להסקה מהירה מאוד בשמונה צעדים עם CFG קבוע של 1.

היתרון המרכזי של שחרור המשקולות בפורמט FP8 הוא צמצום צוואר הבקבוק בחומרה. המודל שוקל 54.6 גיגה בייט ומחולק לארבעה קבצים, כך שעדיין מדובר במשקל כבד, אבל הוא נגיש בהרבה לעומת הפעלת משקולות מלאות ברוחב פס גבוה יותר.

מתאים ל

  • הנפשת תמונות עם קול

    יצירת קטעי וידאו קצרים הכוללים פס קול ישירות מתמונת מקור בלי צורך להדביק אודיו בנפרד.

  • עבודה בתחנות עבודה מקומיות

    הרצה מקומית דרך ComfyUI על גבי חומרת קצה תואמת בלי לשלוח חומרים לשרתים חיצוניים.

  • רינדור מהיר באוטומציות

    שימוש בגרסת הדיסטילציה המהירה להפקת סרטונים בשמונה צעדים בלבד כדי לחסוך זמן חישוב יקר.

איפה זה נופל

המודל מתקשה ביצירת צלילים שאינם דיבור, ובמקרים כאלה איכות האודיו יורדת בצורה מורגשת. הוא סובל מאי דיוקים בהצמדות לטקסט אם צורת הניסוח אינה תואמת בדיוק את הסגנון שהמודל מצפה לו, והוא עלול לפספס חלקים בהנחיה או להפיק תוכן לא הולם. בנוסף, חובה להקפיד שמידות הגובה והרוחב יתחלקו ב־32, ושמספר הפריימים יענה לנוסחה של כפולה של שמונה ועוד אחד, אחרת יש צורך לרפד את הקלט במינוס אחת ולחתוך אותו ידנית בסיום.

אותה משפחה

LTX-2.3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לאימון המשך?

הגרסה המלאה תומכת באימון, אך היוצרים מציינים שבשלב זה מומלץ לאמן על גרסת bf16 של המודל ולא על משקולות ה־FP8. מי שרוצה לאמן על קובצי FP8 ייאלץ לפתח או למצוא מתכוני אימון מותאמים מהקהילה.

איך צריך להכין את התמונה והפריימים כדי שהריצה לא תיכשל?

הרזולוציה חייבת להתחלק ב־32 באורך וברוחב, ומספר הפריימים חייב להיות כפולה של 8 בתוספת 1. אם הממדים שונים, צריך לבצע פדינג עם הערך מינוס אחת ולבצע חיתוך לאחר שהווידאו נוצר.

איך מריצים

כדי להריץ אותו מקומית נדרשת סביבת לינוקס או שרת ייעודי עם Python 3.12 ומעלה, גרסת CUDA מעל 12.7 וכרטיס מסך חזק מאוד עם שפע זיכרון וידאו, שכן מדובר במודל 22B השוקל מעל חמישים גיגה בייט. ההתקנה נעשית ישירות ממאגר הגיטהאב דרך מנהל החבילות uv, או דרך צמתים מובנים בתוך ממשק ComfyUI. קיימת גם תמיכה עתידית בספריית diffusers.

אם אתם מחפשים מהירות, גרסת הדיסטילציה היא הבחירה הטבעית כי היא חותכת את מספר הצעדים לשמונה בלבד. כשאין כרטיס תואם עם עשרות גיגות זיכרון, עדיף להשתמש ב־API או ב־Playground של החברה במקום להסתבך עם קריסות של חוסר זיכרון.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Lightricks/LTX-2.3-fp8")
img = pipe("a photo").images[0]

הקבצים

4 קבצים במאגר, 54.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כמותאם אישית ומפנה לקובץ תנאים ייעודי במאגר. הוא חל על המודל המלא, גרסת הדיסטילציה, מגדילי הרזולוציה וכל תוצר נגזר. לפני שמשלבים את המשקולות במוצר מסחרי חייבים לקרוא את המסמך הספציפי במאגר כדי לוודא שאין בו מגבלות הפצה או שימוש מסחרי שמסכנות את הפעילות.

הרישיון המלא בעמוד המודל ↗