GPT
L

LTX-2.3-ID-LoRA-CelebVHQ-3K

קוד פתוח

AviadDahanother2026-03-18

  • ltx
  • id-lora
  • ltx-2.3
  • audio-video
  • identity-transfer

המתאם הזה מחבר בין תמונת פנים והקלטת קול קצרה כדי לייצר וידאו ואודיו תואמים בריצה אחת. הוא חוסך שרשור מסורבל של מודל קול ומודל וידאו נפרדים.

  • 1.1 GBמשקל הקבצים
  • 2,516הורדות בחודש
  • 64לייקים

מה זה

המשקל הזה הוא מתאם LoRA שמאומן על מאגר CelebV-HQ במשך 3,000 צעדים, ומיועד להלבשה על גבי מודל הבסיס LTX-2.3 בגודל 22 מיליארד פרמטרים. במקום לייצר תמונה לחוד ואז להדביק עליה סינכרון שפתיים מקובץ סאונד חיצוני, הוא מקבל תמונת רפרנס, קטע אודיו קצר וטקסט, ויוצר את שניהם במקביל באותו מעבר חישובי.

הגישה הזו נשענת על דרגת LoRA של 128 ואסטרטגיית אימון שמכוונת לקול ולתמונה יחד. הגרסה הזו נשענת על הדור החדש יותר של Lightricks לעומת גרסת 19B הקודמת, מה שמשפר את ההתאמה בין מה שהדמות אומרת לבין תנועות הפנים והסאונד שנשמע.

מתאים ל

  • הנפשת דמויות מדברות

    יצירת דיבור חי מתמונת סטילס יחידה ודגימת קול קצרה בריצה אחת ללא פיצול מודלים.

  • דיבוב ושמירת זהות קולית

    שמירה על גוון הקול ומראה הפנים המקוריים של הדובר תוך יצירת משפטים חדשים מטקסט.

  • בדיקת היתכנות לאודיו-וידאו

    בחינה מקומית של יצירת מולטימדיה מקבילית בלי לתחזק מודל ראייה ומודל קול נפרדים.

איפה זה נופל

האימון נעשה כולו על CelebV-HQ, מאגר שמורכב ברובו מסרטוני דיבור של סלבריטאים מול מצלמה. בגלל זה, המודל מכוון בעיקר לתקריבים של פנים מדברות, וסביר שיתקשה בסצנות רחבות, תנועות גוף מורכבות או רקעים עמוסים. בנוסף, חובה להזין פרומפט במבנה קשיח שמחלק במפורש בין וידאו, דיבור וצלילי רקע, אחרת התוצאות משתבשות לחלוטין.

שאלות
נפוצות

האם אפשר להריץ את הקובץ הזה לבד בלי מודלים נוספים?

לא. מדובר במשקולות LoRA בלבד בנפח 1.1 גיגהבייט. כדי שהן יעבדו צריך להוריד את מודל הבסיס המלא LTX-2.3 שכולל 22 מיליארד פרמטרים.

מה ההבדל בין גרסת 3K הזו לגרסה הקודמת של ID-LoRA?

הגרסה הקודמת נבנתה מעל מודל LTX-2 בנפח 19B. הגרסה הזו אומנה במשך 3,000 צעדים על מודל הבסיס המעודכן 2.3, וכוללת תמיכה בסקריפט איכות גבוהה שדורש רק 15 צעדי דגימה.

איך צריך לכתוב את הפרומפט כדי לקבל תוצאה תקינה?

הסקריפטים מחייבים תבנית מוגדרת מראש שמפרידה בין מרכיבי הסצנה. חובה להשתמש בתגיות קבועות לחלק החזותי, לחלק של הדיבור ולצלילי הרקע.

איך מריצים

כדי להריץ אותו צריך לשכפל את הריפו הרשמי ID-LoRA, לעדכן את סביבת העבודה לחבילות של גרסה 2.3 באמצעות uv, ולהוריד את קובץ המשקולות ששוקל 1.1 גיגהבייט. יש שלושה מסלולי הרצה: תהליך דו-שלבי רגיל שמתחיל ב־512x512 ומבצע שדרוג רזולוציה, גרסת HQ מומלצת שמריצה 15 צעדים עם דוגם Res2s במקום 30, ומסלול שלב-יחיד למי שמוגבל במשאבים.

המתאם עצמו קל, אבל הוא יושב על מודל בסיס עצום של 22B. אם אין לכם כרטיס מסך חזק מאוד עם זיכרון ייעודי נרחב, חובה להשתמש בדגל הקוונטיזציה שמופיע בסקריפטים, ובמקרים רבים עדיף לשקול שירות ענן שמחזיק את המודל במקום להחזיק שרת כבד רק בשביל זה.

pip install -U huggingface_hub
hf download AviadDahan/LTX-2.3-ID-LoRA-CelebVHQ-3K

הקבצים

5 קבצים במאגר, 1.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי. המשמעות היא שאין היתר גורף לשימוש מסחרי, וצריך לבדוק לעומק את תנאי הרישוי במאגר הגיטהאב של הפרויקט ואת תנאי השימוש של מודל הבסיס LTX-2.3 לפני שמשלבים אותו במוצר.

הרישיון המלא בעמוד המודל ↗