GPT
E

EditAnything

קוד פתוח

Alissonerdxapache-2.02026-05-01

  • diffusers
  • lora
  • video
  • video-editing
  • ltx-2.3

אוסף מתאמי LoRA לעריכת וידאו מונחית טקסט או תמונה על בסיס מודלי LTX. מתאים למפתחים שרוצים לבדוק הוספה, הסרה או החלפת אובייקטים בתוך פריימים קיימים בלי לאמן מודל מאפס.

  • 12.6 GBמשקל הקבצים
  • 10,313הורדות בחודש
  • 97לייקים

מה זה

המאגר כולל ארבעה מסלולי אימון שונים של מתאמי LoRA המיועדים למודלי הווידאו LTX-2.3 ו־LTX-2.5 22B. הגרסה העדכנית ביותר, v2, נבנתה מעל LTX-2.5 כמתאם מסוג IC-LoRA ומסתמכת על וידאו מקור והוראות טקסט ישירות, ללא צורך בתמונת ייחוס או מסיכות. היא מאפשרת שילוב של ארבע פעולות מוגדרות בפרומפט יחיד: הוספה, הסרה, החלפה ושינוי סגנון אזורי, ברזולוציה של 704x384 לאורך 73 פריימים.

בגרסאות המוקדמות יותר המבוססות על LTX-2.3 קיימים מסלולים ייעודיים אחרים. ביניהם תמצאו מתאם להעברת תנועה שבו עורכים רק את הפריים הראשון של הסרטון והמודל משכפל את התנועה משאר הקליפ, מודל מרובה משימות מבוסס פרומפט בלבד בדרגת רנק 256, ומודל ניסיוני המשתמש בתמונת ייחוס בעזרת מודולי צד שמזריקים קשב חזותי ושכבות ייעודיות לתוך בלוקי הטרנספורמר.

מתאים ל

  • החלפת אובייקט בווידאו

    מאפשר להחליף אלמנט קיים בפריים באובייקט אחר לפי תיאור מילולי מוגדר, בתוך חלון של 73 פריימים.

  • העברת תנועה מפריים ערוך

    מסלול v0.1 מאפשר לערוך תמונה בודדת חיצונית ולהחיל עליה את תנועת המצלמה והגוף מסרטון מקור.

  • שינוי סגנון מקומי לחלקים בסרטון

    המרת מראה של קיר, מסך או פנים לסגנון ציורי מוגדר בלי לשנות את מבנה התנועה של שאר הפריים.

איפה זה נופל

זהו ניסוי מחקרי מובהק והמפתח מצהיר במפורש שהוא רחוק מלהיות מוכן לסביבת ייצור וייכשל בקלטים רבים. אוצר המילים מוגבל לארבעה פעלים ספציפיים, והמודל כמעט ולא מגיב לשינויים עדינים מאוד או להסרות מינוריות בפריים. בנוסף, חריגה מגודל של 704x384 או מעבר ל־73 פריימים פוגעת באופן מיידי בעקביות התנועה לאורך זמן. במסלול העברת התנועה, חיתוכי מצלמה ותנועות מהירות מדי שוברים את התוצאה לחלוטין ויוצרים מריחות ועיוותים.

שאלות
נפוצות

האם אפשר להשתמש במתאמים לעריכת סרטונים באורך מלא?

לא. המתאמים אומנו על קטעים קצרים מאוד של 73 פריימים בלבד. ניסיון לייצר סרטונים ארוכים יותר או לעבד קטעים עם חיתוכי מצלמה יוביל לאובדן עקביות ולעיוותים חזותיים כבדים.

באיזה מתאם מתוך הארבעה כדאי להתחיל לעבוד?

במתאם v2 שנבנה עבור LTX-2.5. זהו המסלול הפעיל שאינו מצריך מודולי צד מורכבים או תמונות ייחוס, ומקבל הוראות טקסט ישירות יחד עם סרטון המקור.

איך מריצים

ההרצה המומלצת מתבצעת דרך ComfyUI באמצעות צמתי ההרחבה של BFSnodes. גרסה v2 דורשת להוריד את המתאם היחיד ולטעון את קובץ התהליך המצורף, בעוד שמסלול תמונת הייחוס דורש טעינה מקבילה של שני קבצים, הקובץ הרגיל ומודול התוספות שמתחבר לסמפלר ייעודי. מכיוון שמודל הבסיס בגרסה העדכנית הוא LTX-2.5 בעל 22 מיליארד פרמטרים, נדרש מאיץ גרפי חזק מאוד עם זיכרון וידאו משמעותי כדי להחזיק את המודל, מודול הווידאו והמתאמים במקביל.

חובה להזין את הפרומפטים בדיוק במבנה שהמתאם אומן לפיו. בגרסה v2 כל הנחיה חייבת להתחיל במילת ההפעלה הייעודית ולאחריה פעלים ספציפיים באנגלית עם עשר עד עשרים מילים לפעולה. הגדרות ההסקה של המתאם דורשות לרוב עוצמת LoRA של 1.0, ערך CFG שנע בין 3 ל־5, ו־30 צעדי דגימה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Alissonerdx/EditAnything")
img = pipe("a photo").images[0]

הקבצים

40 קבצים במאגר, 12.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש חופשי, כולל שימוש מסחרי, שינוי הקוד והפצה מחדש של הקבצים. התנאים העיקריים דורשים שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית, וציון שינויים שבוצעו אם מפיצים את המשקלים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗