GPT
L

LTX-2.5-Multiple-Subject-Reference

קוד פתוח

LiconStudioapache-2.02026-08-14

  • diffusers
  • video-generation
  • multi-reference
  • LTX-2.5

תוספת LoRA שמביאה יצירת וידאו מבוססת מספר תמונות מקור במקביל. הפתרון נועד למי שרוצה לשמור על עקביות של דמויות, בגדים וחפצים שונים באותו שוט.

  • 1.4 GBמשקל הקבצים
  • 7,681הורדות בחודש
  • 61לייקים

מה זה

מדובר במשקולות LoRA עבור LTX 2.5 שמיישמות גישה בשם Multiple Subject Reference. במקום להסתמך על תמונה בודדת או פרומפט טקסט בלבד, המנגנון מקודד עד חמש תמונות רפרנס שונות ישירות לתוך המרחב הלטנטי של הווידאו המיועד. כל תמונה מקבלת שיבוץ מיקום שלילי בזמן ווקטור זיהוי משלה, כך ששכבות תשומת הלב הפנימיות של המודל שולפות את הפרטים ישירות מכל מקור.

ההבדל המשמעותי מול שיטות רגילות הוא היכולת להפריד בין אלמנטים שונים. תמונה אחת יכולה להגדיר פנים של דמות, תמונה שנייה את פריט הלבוש, ותמונה שלישית את הרקע או חפץ שהיא מחזיקה. זה מיועד במיוחד לחיבור מורכב בין כמה נושאים בלי שהתכונות של אחד יימרחו על האחר.

מתאים ל

  • עקביות דמויות בווידאו

    יצירת סצנה שבה הדמות, הבגדים והרקע מוגדרים מתמונות נפרדות ונשמרים יציבים לאורך התנועה.

  • הצגת מוצר בידי אדם

    שילוב חפץ ספציפי מתמונה אחת בידיים של דמות מתמונה אחרת בלי עיוותים של צבע וצורה.

  • אינטראקציה בין דמויות

    הכנסת שתי דמויות שונות משני מקורות נפרדים לאותה סצנה תוך שמירה על תווי הפנים של כל אחת.

איפה זה נופל

ההצלחה כאן תלויה לחלוטין באיכות ודיוק הפרומפט. המפתחים מדגישים שחובה לתייג כל תמונה במפורש, לקרוא להן בשמות קבועים, ולהגדיר בדיוק איזה חלק מגיע מאיזה קובץ. בלי ניסוח קפדני של היחסים המרחביים והפעולות, המודל מתבלבל בין מקורות המידע. בנוסף, מדובר בגרסת V1 ראשונית שמוגבלת לתקרה של חמש תמונות, והיא נשענת על תוסף ComfyUI חיצוני ספציפי כדי לעבוד כמו שצריך.

שאלות
נפוצות

האם אפשר להשתמש ביותר מחמש תמונות רפרנס?

לא. התמיכה המובנית מוגבלת לעד חמש תמונות מקור במקביל. אם מנסים להזין יותר, צריך לבחור את חמשת האלמנטים המרכזיים ביותר בסצנה.

האם המודל עובד ישירות בסביבת ComfyUI רגילה?

לא באופן אוטומטי. צריך להתקין את התוסף ComfyUI LTX2.5 MSR מהמאגר של המפתחים, שכולל את הצמתים המותאמים ואת זרימת העבודה הייעודית.

איך מריצים

המשקל הכולל של הקבצים קטן יחסית, 1.4 גיגה בייט המחולקים לעשרות קבצים, וההרצה מבוססת diffusers. כדי להריץ את זה בסביבת עבודה נוחה צריך להשתמש בתוסף ייעודי בשם ComfyUI LTX2.5 MSR שכולל workflow לדוגמה. המשקולות עצמן קלות, אבל צריך לזכור שהן נטענות מעל מודל הבסיס של LTX 2.5, כך שדרישות הזיכרון בכרטיס המסך נקבעות לפי מודל הווידאו הראשי.

אם יש לכם כרטיס גרפי מתאים להרצת LTX 2.5 מקומית, אין שום סיבה לחפש שירות ענן חיצוני כי השליטה המקומית בניתוב התמונות קריטית כאן. במידה ואין לכם תשתית גרפית חזקה למודל הבסיס, תצטרכו להרים מכונה ייעודית בענן.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("LiconStudio/LTX-2.5-Multiple-Subject-Reference")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בקוד ובמשקולות לצרכים מסחריים, לשנות, להפיץ ולשלב אותם במוצר סגור. הדרישה העיקרית היא לשמור על הודעות זכויות היוצרים ונוסח הרישיון המקורי בקבצים הרלוונטיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗