GPT
L

LTX2.3-ICEdit-Insight

קוד פתוח

joyfoxapache-2.02026-04-23

  • diffusers
  • video-editing
  • video-restoration
  • ltx-video
  • ltx-2-3

שחזור וידאו ומחיקת אובייקטים מבוססי מודל יוצר במרחב הלטנטי, שמנקים כתוביות או סימני מים בלי לטשטש את הרקע ותוך שמירה על עקביות בין פריימים עוקבים.

  • 28.2 GBמשקל הקבצים
  • 42,003הורדות בחודש
  • 173לייקים

מה זה

הארכיטקטורה מבוססת על מודל הבסיס LTX-2.3 מסוג Diffusion Transformer, אבל במקום לעבוד פר פריים כמו פילטרים קלאסיים, היא פועלת כולה במרחב הלטנטי של הווידאו. הפיתוח כולל מודל בסיס מכווץ בפורמט FP8 לצד מתאמי LoRA ייעודיים לארבע משימות מוגדרות: שחזור כללי של דגרדציה ודחיסה, שיפור חדות ורזולוציה, מחיקת סימני מים ומחיקת כתוביות מוטמעות.

המבנה הטכני נשען על שלושה רכיבים מהמאמר של המפתחים: מתאם שמפריד בין מבנה לטקסטורה, יישור מבוסס זרימה אופטית ותשומת לב חוצת פריימים, וניתוב רב משימתי בזמן האימון. בפועל, החיבור הזה נועד לחזות באופן יצירתי מה הסתתר מאחורי טקסט או לוגו על בסיס התנועה והתאורה סביבו, במקום להסתפק בהחלקה מטושטשת.

מתאים ל

  • ניקוי כתוביות מוטמעות

    מחיקת טקסט שנצרב על גבי הווידאו באמצעות שחזור לטנטי שמשלים את הרקע והתנועה בלי למרוח את התמונה.

  • הסרת סימני מים ולוגואים

    הורדת לוגואים חצי שקופים מסרטוני רשת קצרים, תוך ניצול עקביות בין פריימים כדי לשחזר את האובייקטים שמאחוריהם.

  • שחזור סרטונים דחוסים

    תיקון ארטיפקטים, רעשי חיישן וטשטוש תנועה בווידאו ברזולוציה נמוכה באמצעות מתאם שחזור ייעודי.

איפה זה נופל

בכרטיס המודל מודגש שהסרת סימני מים וכתוביות עובדת טוב רק כשהאזור המוסתר יציב ואינו גדול מדי, כך שחסימות נרחבות או רקע בתנועה חריגה ייצרו עיוותים. נוסף לכך, קיימות מגבלות הנדסיות קשיחות בזמן ההרצה: מספר הפריימים חייב להתאים לתבנית של שמונה כפול k ועוד אחד, והרזולוציה מחייבת כפולות של 32. קטעים עם תנועה מהירה עלולים לאבד עקביות מבנית אלא אם מגבילים את רמת הדינואיז, ואיכות השחזור מושפעת ישירות מרמת הדחיסה של סרטון המקור.

שאלות
נפוצות

האם אפשר להריץ את המודל על כל אורך של סרטון?

לא. סקריפט ההרצה מכוון למקטעים קצרים, ומספר הפריימים הכולל חייב לעמוד בתנאי של 8k+1, כמו למשל 97 פריימים. כדי לעבד סרטונים ארוכים יותר תצטרכו לחתוך אותם למקטעים קטנים ולתפור אותם מחדש.

האם המודל מטשטש את הכתוביות כמו פילטרים ישנים?

לא. הוא מודל דיפוזיה יוצר שפועל במרחב הלטנטי ומנסה לשער מחדש את הטקסטורה והמבנה שהיו קיימים מאחורי הטקסט. היתרון הוא תוצאה חדה וטבעית יותר, אך החיסרון הוא סיכון להמצאת פרטים שלא היו שם.

למה מוגדרים ארבעה קובצי LoRA שונים?

כל מתאם אומן על משימה ייעודית באמצעות מנגנון שמפריד בין שחזור מבני לעריכה סמנטית. במקום מודל אחד שמנסה לעשות הכל בינוני, אתם טוענים את ה־LoRA שמתאים בדיוק לפעולה הרצויה: שחזור, שדרוג חדות, ניקוי לוגו או ניקוי טקסט.

איך מריצים

להרצה מקומית תצטרכו כרטיס מסך כבד מאוד, שכן רק קובצי המודל תופסים 28.2 גיגה בייט. סקריפט ההרצה דורש הפעלה של זיכרון מקטעים מתרחב ב־PyTorch, מה שמעיד על עומס VRAM חריג אפילו בפורמט FP8 עבור קטעים של 97 פריימים. המערכת מחייבת כרטיס תומך CUDA עדכני, ועדיף להישאר בהרצה חד שלבית כדי לא לאבד את השפעת מתאמי ה־LoRA.

מי שאין לו שרת ייעודי עם מעבד גרפי של 24 או 48 גיגה בייט לפחות, עדיף שיחכה לשירות מנוהל או יפנה לתשתית ענן מותאמת. הרצת תהליך כזה על חומרה ביתית פשוט תתרסק עם שגיאות מחסור בזיכרון.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("joyfox/LTX2.3-ICEdit-Insight")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מפורסם תחת רישיון Apache 2.0, שמתיר שימוש מסחרי, שינוי קוד והפצה חופשית, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון. עם זאת, המפתחים מציינים במפורש שיש לבדוק בנפרד את תנאי הרישיון של מודל הבסיס שעליו הוא נשען לפני שילוב שלו במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗