GPT
L

LTX-2.3-nvfp4

קוד פתוח

Lightricksother2026-03-16

  • diffusers
  • image-to-video
  • text-to-video
  • video-to-video
  • image-text-to-video

גרסה מכווצת בפורמט NVFP4 למודל שמייצר וידאו יחד עם סאונד מסונכרן מתמונה וטקסט. המטרה כאן היא להריץ מודל של 22 מיליארד פרמטרים מקומית בלי לאבד מאיכות התנועה והקול.

  • 20.2 GBמשקל הקבצים
  • 6,523הורדות בחודש
  • 97לייקים

מה זה

מדובר במודל מבוסס DiT של חברת לייטריקס שמייצר וידאו ואודיו תואם בתוך אותה ריצה. בשונה מרוב הכלים שמייצרים רק אנימציה שקטה ומחייבים אתכם לחבר מודל נפרד לפס הקול, הוא מוציא את שניהם יחד. העדכון הנוכחי שיפר את איכות הוויזואליה, הדיוק בהבנת הפרומפט ואיכות הצליל ביחס לגרסאות קודמות.

המשקל עומד על כעשרים ג'יגה בייט בזכות קוונטיזציה מיוחדת, שנועדה לדחוס מודל 22B לרמת דיוק של 4 ביט בלי ריסוק האיכות שנפוץ בהמרות כאלה. המודל שקיים כרגע להורדה הוא גרסת הפיתוח הגמישה, כשגרסה מזוקקת של שמונה צעדים אמורה לצאת בהמשך.

מתאים ל

  • הנפשת תמונות סטילס עם קול

    יצירת קליפ קצר עם דיבור וסאונד מסונכרן מתמונה אחת והוראות טקסט, בלי לחבר מודל אודיו חיצוני.

  • עבודה מקומית ב־ComfyUI

    שילוב בתהליכי יצירה קיימים דרך צמתים רשמיים, בתנאי שיש כרטיס מסך שתומך בפורמט NVFP4.

  • אימון וחידוד המודל

    התאמת גרסת ה־dev לצורכי הפקה ייעודיים בעזרת כלי האימון המובנים של החברה.

איפה זה נופל

יש פה כמה מגבלות טכניות קשיחות שחייבים לקחת בחשבון. ממדי הגובה והרוחב של הווידאו חייבים להתחלק ב־32 בלי שארית, ומספר הפריימים חייב להיות כפולה של שמונה ועוד אחד, אחרת תצטרכו לרפד את הקלט ולחתוך אותו ידנית. בנוסף, המודל מתקשה ביצירת צלילים שאינם דיבור, ובמקרים כאלה איכות האודיו יורדת בצורה מורגשת.

רמת ההיענות להוראות תלויה מאוד בסגנון הניסוח, ויש נפילות בהתאמה המדויקת לפרומפט. הוא גם עלול לפלוט תוכן פוגעני ולא מיועד בשום צורה לחלץ או להציג עובדות היסטוריות או מציאותיות.

שאלות
נפוצות

האם אפשר להריץ אותו דרך ספריית Diffusers?

נכון לעכשיו התמיכה הרשמית בספרייה הזו עדיין בתהליך עבודה וטרם שוחררה. בינתיים מריצים אותו ישירות ממאגר הקוד של לייטריקס או דרך המודולים הייעודיים של ComfyUI.

למה הווידאו נכשל ברינדור או נחתך מוזר?

המודל דורש ממדים מדויקים שמתחלקים ב־32 לפיקסלים, וכמות פריימים שמתאימה לנוסחה של שמונה פלוס אחד. אם הקלט שלכם לא יושב בדיוק על המספרים האלה, צריך לרפד את הפריימים בערך מינוס אחת ולחתוך את התוצאה אחרי היצירה.

האם כדאי לאמן את המשקולות בגרסה הזו?

היוצרים ממליצים לאמן דווקא את גרסת ה־bf16 המלאה של המודל ולא את גרסת ה־nvfp4 הזו. גרסאות מכווצות מיועדות בעיקר להרצה מהירה ולא לסבבי אימון כבדים.

איך מריצים

כדי לעבוד איתו תצטרכו סביבת לינוקס עם פייתון 3.12 לפחות, גרסת קודה מתקדמת מ־12.7, ותמיכה בפורמט NVFP4 שמוגבל לכרטיסי מסך תואמים של אנבידיה. הקוד המקורי מנוהל במאגר הגיטהאב של לייטריקס דרך מנהל החבילות uv, ויש גם צמתים ייעודיים לעבודה בתוך ComfyUI.

אם אתם לא מחזיקים חומרה מתאימה עם מספיק זיכרון וידאו לטעינת עשרים ג'יגה בייט ועיבוד פריימים, שווה להשתמש ב־API Playground שלהם במקום להסתבך עם הגדרות מקומיות.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Lightricks/LTX-2.3-nvfp4")
img = pipe("a photo").images[0]

הקבצים

3 קבצים במאגר, 20.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ומפנה לקובץ תנאים ייעודי במאגר של לייטריקס שמכסה את המודל ונגזרותיו. אי אפשר להניח שמדובר ברישיון קוד פתוח סטנדרטי כמו MIT או אפאצ'י, ולכן לפני הטמעה במערכת מסחרית חובה לקרוא את קובץ הרישיון המקורי ולבדוק אילו הגבלות הפצה חלות עליכם.

הרישיון המלא בעמוד המודל ↗