GPT
L

Ltx2.3-VBVR-lora-I2V

קוד פתוח

LiconStudioother2026-04-08

  • diffusers
  • video-generation
  • video-reasoning
  • logical-reasoning
  • lora

מתאם משקולות שמלמד מודל וידאו להבין פיזיקה, תנועות מורכבות ואינטראקציה בין עצמים מתוך תמונה. הוא נועד למי שצריך תנועה הגיונית ולא סתם מריחות יפות בעין.

  • 1.9 GBמשקל הקבצים
  • 6,360הורדות בחודש
  • 248לייקים

מה זה

מדובר במתאם LoRA שמאומן על גבי מודל הבסיס ltx-2.3-22b-dev, כשהמטרה שלו היא פתרון בעיות של הסקת מסקנות בווידאו מתמונה. הוא אומן בשלושה שלבים על דאטה־סט בשם VBVR שכולל כמיליון סרטונים המחולקים למאה קטגוריות שונות, ביניהן תנועה במסלול, יחסי סיבה ותוצאה, התנגשויות ותכנון נתיבים במרחב.

התוספת הזו מתמקדת בדיוק פיזיקלי ובשמירה על עקביות של פרטים, תאורה ויציבות מצלמה לאורך זמן. במקום תנועות רובוטיות או עיוותים אקראיים שנפוצים במודלי וידאו כשיש עומס של אלמנטים, המתאם מנסה לכפות תאוצה והאטה טבעיות וסנכרון בין מספר אובייקטים שנמצאים באותו פריים.

מתאים ל

  • הנפשת התנגשויות ופיזיקה

    יצירת הדמיות מתמונה שבהן עצמים מתגלגלים, מתנגשים ומגיבים לחוקי משיכה בצורה טבעית.

  • סצנות מרובות אובייקטים

    שליטה בתנועה מתואמת של מספר אלמנטים נפרדים באותו פריים בלי שהם יימרחו או ייעלמו.

  • הפקת וידאו עם תנועה מוגדרת

    תרגום הנחיות מילוליות מורכבות שמפרטות נתיב, כיוון וסדר פעולות מדויק בזמן.

איפה זה נופל

ההתמקדות כאן היא פיזיקה והבנת פרומפטים מורכבים, לא בהכרח ריאליזם קולנועי עשיר או סגנונות אמנותיים מגוונים. בנוסף, האימון התבסס על אנגלית וסינית בלבד, כך שאין מה לנסות להזין הנחיות בעברית. הכרטיס גם לא מציג מדדי ביצועים מספריים עצמאיים כמו בדיקות אנושיות או השוואות בנצ'מרק מדודות, אלא רק הדגמות וידאו מהשלבים השונים.

שאלות
נפוצות

האם אפשר להריץ את הקבצים האלה לבד בלי מודל נוסף?

לא. מדובר במתאם LoRA בלבד ולא במודל עצמאי. חייבים להוריד ולהטעין ברקע את ltx-2.3-22b-dev כדי שהמשקולות האלו יעבדו.

האם המודל מבין הוראות שנכתבו בעברית?

הוא אומן על אנגלית וסינית בלבד. אם תכתבו פרומפט בעברית תקבלו תוצאות שבורות או התעלמות מוחלטת מחלקי המשפט, לכן חובה לתרגם לאנגלית לפני השליחה.

איך מריצים

המשקולות עצמן שוקלות רק 1.9 גיגה־בייט ורצות דרך diffusers, אבל הן מתלבשות על מודל בסיס עצום של 22 מיליארד פרמטרים. כדי להריץ את השילוב הזה מקומית ב־BF16 דרוש כרטיס מסך כבד מאוד עם נפח VRAM משמעותי, או מערך של מספר כרטיסים ייעודיים.

אם אין לכם שרת עם החומרה המתאימה, להחזיק תשתית כזו רק בשביל כמה סרטונים בודדים ביום יעלה לכם הרבה כסף וחשמל. במקרה כזה עדיף לשכור מכונה לפי שעה בענן או להמתין שמישהו יציע שירות API מבוסס המודל.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("LiconStudio/Ltx2.3-VBVR-lora-I2V")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר כ־other ללא טקסט משפטי מלא או פירוט תנאים בכרטיס המודל. במצב כזה אי אפשר לדעת אם מותר לשלב אותו במוצר מסחרי, ועד שהיוצרים לא יבהירו את התנאים, מפתחים צריכים להתייחס אליו כמיועד למחקר ולניסויים בלבד.

הרישיון המלא בעמוד המודל ↗