GPT
L

LTX-2.3-Multiple-Subject-Reference

קוד פתוח

LiconStudioapache-2.02026-06-01

  • diffusers
  • video-generation
  • multi-reference
  • LTX-2.3

ההרחבה הזו מאפשרת לייצר וידאו מבוסס LTX-2.3 תוך שמירה על עקביות של שניים עד חמישה אובייקטים או דמויות שונות מתמונות מקור נפרדות. היא עושה את זה בלי להוסיף רכיבי רשת חדשים למודל הבסיס.

  • 2.2 GBמשקל הקבצים
  • 9,768הורדות בחודש
  • 257לייקים

מה זה

מדובר בגרסה שנייה למנגנון MSR עבור מודל הווידאו LTX-2.3, שמופץ כתוסף LoRA במשקל של 2.2 גיגה בייט. השיטה פה הופכת תמונות סטילס לרצף דמוי וידאו שחולק את אותו מרחב ייצוג, כך ששכבות תשומת הלב הקיימות ניגשות ישירות לטוקנים של תמונות המקור. במקום לדחוס כל תמונה לווקטור בודד, המערך שומר פרטים ברמת הטוקן, מה שמסייע בשילוב פנים מתמונה אחת, בגדים מאחרת ורקע משלישית.

הגרסה הזו מתמקדת בשיפור היציבות בין דגימות חוזרות וצמצום תופעות כמו הבהובים ואיבוד זהות לאורך הפריימים. לפי התיעוד היא גם מבינה טוב יותר יחסים במרחב ובזמן, למשל פעולות שבהן דמות אחת מעבירה חפץ לאחרת, כל עוד התמונות מספקות את המידע הדרוש לכל ישות.

מתאים ל

  • שילוב דמויות קבועות בסצינה

    יצירת שוט שבו שתי דמויות שונות מתמונות מקור נפרדות פועלות יחד באותו פריים בלי לאבד את תווי הפנים.

  • הנפשת מוצר בידי אדם

    חיבור תמונת רפרנס של מוצר מסוים עם תמונת רפרנס של שחקן כדי להפיק סרטון הדגמה שבו השחקן אוחז בפריט.

  • מיזוג תכונות בין מקורות

    הפקת דמות שלוקחת תווי פנים מתמונה ראשונה, בגד ספציפי מתמונה שנייה וסגנון רקע מתמונה שלישית.

איפה זה נופל

המודל רגיש מאוד לאופן ניסוח הפרומפט. תיאור ארוך מדי או קצר מדי של תמונות הרפרנס פוגע בעקביות, וצריך להגדיר בדיוק את התפקיד של כל ישות בסצינה. באינטראקציות מורכבות בין כמה דמויות עדיין נדרשות כמה דגימות חוזרות כדי לקבל תוצאה תקינה, ובסצינות עם תנועה מהירה המפתחים ממליצים לעבוד בקצב של 50 פריימים לשנייה, עניין שמכביד משמעותית על החישוב.

שאלות
נפוצות

האם אפשר להריץ את זה בספריית diffusers רגילה בלי ממשקים נוספים?

הקבצים אמנם מותאמים לפורמט diffusers, אך התיעוד הרשמי מפנה במפורש לשימוש בתוסף ComfyUI-Licon-MSR. כדי להשתמש בו ישירות בסקריפט פייתון מותאם אישית תצטרכו לממש את לוגיקת קידוד רצף הרפרנסים בעצמכם או להסתמך על קוד התוסף.

כמה תמונות מקור המודל מסוגל לקבל בכל הרצה?

המנגנון תומך בין שתיים לחמש תמונות רפרנס בו זמנית. אפשר לחלק ביניהן תפקידים שונים כמו דמויות, חפצים, טקסטורות מקומיות, זוויות צילום שונות או רקעים.

האם המודל כולל בתוכו את מודל הווידאו המלא?

לא, מדובר במשקולות LoRA בנפח 2.2 גיגה בייט שמיועדות לעבודה על גבי מודל הבסיס LTX-2.3. חובה להחזיק את מודל הבסיס בסביבת העבודה כדי לחבר אליו את השכבות האלו.

איך מריצים

כדי לעבוד איתו צריך סביבת ComfyUI ואת התוסף ComfyUI-Licon-MSR שמספק את זרימת העבודה המתאימה. המודל עצמו נשען על diffusers ומגיע כמשקל LoRA, אבל הוא דורש הרצה של מודל הבסיס LTX-2.3 ברקע, מה שמחייב כרטיס מסך חזק עם נפח זיכרון מכובד להתמודדות עם ריבוי תמונות רפרנס ורצפי וידאו.

בכרטיס לא צוינו דרישות חומרה מדויקות בספרות או קיומו של ממשק API רשמי בענן. אם אין לכם עמדת עיבוד מקומית או שרת ייעודי שמריץ את LTX-2.3 בצורה חלקה, תצטרכו להקים תשתית עצמאית בענן כדי לא להיתקע על זמני רינדור ארוכים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("LiconStudio/LTX-2.3-Multiple-Subject-Reference")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא Apache 2.0. הוא מתיר שימוש מסחרי, שינוי של הקוד והפצה מחדש בלי תשלום תמלוגים, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון. שימו לב שרישיון זה חל על משקולות ה־LoRA עצמן, ויש לוודא בנפרד את תנאי השימוש וההפצה של מודל הבסיס LTX-2.3.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗