GPT
L

ltx2.3-audio-reactive-lora

קוד פתוח

falother2026-06-11

  • diffusers
  • lora
  • safetensors
  • ltx
  • ltx-2

המתאם הזה מחבר בין קטעי סאונד לתנועה בווידאו על בסיס LTX-2.3. אם אתם צריכים קליפ או ויז'ואל שמגיב מדויק לבאסים ולמקצב של טראק, בשביל זה הוא נבנה.

  • 2.5 GBמשקל הקבצים
  • 3,881הורדות בחודש
  • 64לייקים

מה זה

מדובר במתאם LoRA שמתלבש על מודל הבסיס LTX-2.3 של לייטריקס ומתמקד בסנכרון בין תנועה לתדרי שמע. במקום סתם לייצר אנימציה כללית מתמונה ופרומפט, הוא מכוון את התנועה בווידאו לפעימות התופים, לסנייר ולשינויים בסינתיסייזר. גרסת V2 שלו מקצינה את התגובה לסאונד ודוחפת אפקטים כמו עשן, חלקיקים, עיוותי צורה והבזקי אור שזזים ישירות עם הקצב.

התוצאה הכי טובה מתקבלת כשמזינים תמונת מקור כפריים ראשון יחד עם קובץ הקול והטקסט, בעיקר כשיש בתמונה אלמנטים גאומטריים ברורים כמו קוביות או שכבות גרפיות. אפשר להריץ אותו גם בלי תמונת פתיחה ישירות מסאונד, אבל אז מאבדים חלק ניכר מהשליטה על הכיוון האמנותי.

מתאים ל

  • קליפים מבוססי מקצב

    יצירת קטעי וידאו שמגיבים ישירות לבאסים ולתופים מתוך קובץ מוזיקה קיים.

  • ויז'ואלייזר לאודיו

    הנפשת תמונות סטילס גרפיות וגאומטריות בלופים של 5 עד 15 שניות לסושיאל.

  • אנימציית לוגו לסאונד

    יצירת פתיחים קצרים שמתפוצצים וזזים לפי צליל פתיחה מוגדר מראש.

איפה זה נופל

המתאם לא מבטיח סנכרון מושלם לקצב בכל רינדור, ועדיין יהיו קטעים שבהם התנועה תרגיש מנותקת מהשמע. בנוסף, טקסט ולוגואים בפריים הראשון נוטים להתעוות ולאבד יציבות במהלך הווידאו, כך שאי אפשר להסתמך עליו למיתוג חד בלי לבדוק כל פלט ידנית.

שאלות
נפוצות

האם המתאם יודע לסנכרן כל שיר באופן אוטומטי?

הוא לא מזהה ביטים בצורה מתמטית מושלמת, אלא מגיב לתדרי אודיו ברמת המודל. כדי לקבל פגיעות מדויקות בקצב, צריך לעזור לו בפרומפט מפורש ולהשתמש בתמונת פתיחה עם עומק וצורות מוגדרות.

איזה קובץ עדיף להוריד, את הרגיל או את V2?

קובץ ה־V2 מביא תנועה הרבה יותר אגרסיבית ומורגשת בתגובה לבאסים ולמקצב. אלא אם אתם מחפשים תנודות עדינות במיוחד, עדיף להתחיל ישר מגרסת V2.

איך מריצים

כדי להריץ אותו מקומית דרך diffusers או ComfyUI, אתם צריכים סביבה שתומכת בטעינת LoRA עבור LTX-2.3 וביצירת וידאו מותנית אודיו. קובצי המשקל שוקלים 2.5 גיגה בייט, אבל הם דורשים את מודל הבסיס המלא, כך שחובה כרטיס מסך חזק מאוד עם נפח זיכרון מכובד כדי להחזיק את כל הצינור הזה ברזולוציית 1024x1024 וקצב של 24 פריימים לשנייה.

גרסת V2 מציעה תגובות אגרסיביות יותר לבאסים מאשר קובץ הבסיס הראשון. אם אין לכם חומרה כבדה וייעודית לווידאו, עדיף להשתמש בנקודת הקצה המוכנה של fal.ai, שמריצה בדיוק את ההגדרות האלה וחוסכת את כאב הראש של הקמת הסביבה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("fal/ltx2.3-audio-reactive-lora")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר כ־other ומסתמך על LTX-2 Community License Agreement של מודל הבסיס. זה אומר שחלים עליכם כל התנאים והמגבלות של לייטריקס לגבי שימוש מסחרי, הפצה והטמעה במוצרים.

הרישיון המלא בעמוד המודל ↗