GPT
L

LTX-2.3-22b-AV-LoRA-talking-head

קוד פתוח

elix3ropenrail2026-03-24

  • diffusers
  • lora
  • ltx-video
  • talking-head
  • video-generation

ההרחבה הזו מייצרת וידאו מדבר מתמונה עם סנכרון שפתיים וקול פנימי. היא חוסכת הזנת אודיו נפרד בזמן היצירה ומספקת תבנית מלאה לאימון דמות משלכם.

  • 416 MBמשקל הקבצים
  • 3,708הורדות בחודש
  • 74לייקים

מה זה

מדובר בתוסף LoRA ראשון מסוגו עבור LTX-Video 2.3 בגודל 22B, שמנצל את ארכיטקטורת תשומת הלב המשותפת בין אודיו לווידאו. במקום לחבר קובץ קול חיצוני ולנסות להלביש עליו תנועות שפתיים, המודל מפנים את מאפייני הקול ישירות מתוך הדאטהסט ומפיק דיבור וקול מסונכרנים ישירות מטקסט ותמונה.

המשקלים עצמם מאומנים על דמות בודדת ומדגימים שימור זהות שמתייצב בצעד 1250 ומשתפר עד סוף האימון בצעד 2000. הערך המרכזי כאן אינו רק הדמות הספציפית הזו, אלא שחרור צינור העבודה השלם, כולל קובצי הגדרות ותרשימי זרימה שמאפשרים לאמן דמויות חדשות באותה שיטה.

מתאים ל

  • אימון דמות מדברת מותאמת

    משתמשים בקונפיגורציית האימון ובפורמט הכתוביות כדי לאמן דמות ייעודית על תשתית LTX 2.3.

  • הפקת דיבור מאויר מתמונה

    יוצרים סרטוני דיבור ישירות מתמונת מקור של הדמות המאומנת ללא צורך בהקלטת קול נפרדת.

  • בדיקת היתכנות לאודיו-וידאו

    בוחנים את היכולות של LTX-Video 2.3 לשלב קול ותמונה ללא מודל סנכרון שפתיים חיצוני.

איפה זה נופל

הקול המופק כולל זמזום רקע קל כתוצאה מעיבוד האודיו באימון. תנועות מצמוץ העיניים לא תמיד עקביות, ואיכות הפלט תלויה מאוד בסיד, כך שתצטרכו להריץ בין שלושה לחמישה סידים שונים כדי לבחור תוצאה טובה. מעבר לכך, המשקלים נעולים לדמות אחת ספציפית, ורקעים מורכבים פוגעים ישירות ברמת הדיוק של סנכרון השפתיים.

שאלות
נפוצות

האם אפשר להשתמש במודל כדי לדובב כל דמות שארצה?

לא. המשקלים הספציפיים האלה מאומנים על דמות אחת בלבד וקולה הוטמע בתוכם. כדי לייצר אדם אחר, עליכם לאסוף לפחות 25 קליפים ולאמן LoRA חדש לפי המדריך המצורף.

איך כותבים את הפרומפט כדי שהדמות תדבר?

מגדירים את מילת ההפעלה OHWXPERSON, מוסיפים תיאור חזותי של הסצנה, ומסיימים בטקסט מדויק של מה שהדמות אומרת במירכאות.

איך מריצים

טוענים את קובץ המשקלים בנפח 416 מגה בייט לתוך ComfyUI בעזרת Power Lora Loader מעל מודל הבסיס LTX-2.3 22B, עם עוצמה מכוונת ל־1.0 ומילת הפעלה OHWXPERSON. ההרצה דורשת רזולוציה של 1280x736 בקצב של 24 פריימים לשנייה, או 1280x704 בקצב 25 פריימים לשנייה אם משלבים אודיו חיצוני.

המשקלים קלים, אבל מודל הבסיס דורש חומרה כבדה מאוד. אימון המודל דרש 77.08 גיגה בייט של זיכרון וידאו על כרטיס RTX PRO 6000 96GB, כך שאם אין לכם תשתית ענן ייעודית או מעבד גרפי מקצועי, עדיף להמתין לשירותי ענן שיציעו את הבסיס כנקודת קצה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("elix3r/LTX-2.3-22b-AV-LoRA-talking-head")
img = pipe("a photo").images[0]

הרישיון

הקוד וההגדרות מתויגים תחת openrail, אך כרטיס המודל מגביל את משקלי ה־LoRA למחקר ולשימוש אישי בלבד. שימוש מסחרי מותנה בקבלת אישור נפרד מהיוצר, כך שלא תוכלו לשלב את המשקלים הקיימים במוצר מסחרי ללא פנייה ישירה אליו.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗