GPT
L

LTX-2.3-ID-LoRA-TalkVid-3K

קוד פתוח

AviadDahanother2026-03-18

  • ltx
  • id-lora
  • ltx-2.3
  • audio-video
  • identity-transfer

התאמת וידאו וקול של דובר במעבר יחיד, בלי להדביק אודיו בנפרד. מתאים למי שרוצה וידאו מדבר מבוסס תמונה ודגימת קול בלי לפצל תהליכים.

  • 1.1 GBמשקל הקבצים
  • 2,351הורדות בחודש
  • 60לייקים

מה זה

מדובר במשקולות LoRA בדרגה 128 שאומנו על בסיס LTX-2.3 בנפח 22 מיליארד פרמטרים, במשך 3,000 צעדים על מאגר TalkVid. במקום לעבוד בשרשרת שמייצרת קול ואז מזיזה שפתיים, הוא פועל במרחב לטנטי אחיד שבו טקסט, תמונת מקור וקובץ אודיו קצר מכתיבים יחד את התנועה, האקוסטיקה של החלל וסגנון הדיבור.

ההבדל המשמעותי מול הגרסה הקודמת של LTX-2 בנפח 19 מיליארד פרמטרים הוא הדיוק בשמירה על זהות הדובר. ההפצה הנוכחית שוקלת רק 1.1 גיגה בייט ומיועדת להרכבה על מודל הבסיס, כך שמקבלים יכולת ייצור דוברים משולבת וידאו וסאונד בלי לאמן מודל שלם מאפס.

מתאים ל

  • דיבוב דמויות מונפשות

    יצירת וידאו וקול מתואמים מקובץ שמע קצר ותמונת בסיס במעבר יחיד.

  • סרטוני הדרכה מותאמים

    הפקת סרטוני הסבר עם דובר קבוע בלי להקליט אולפן בכל פעם מחדש.

  • בדיקת היתכנות לאווטארים

    בחינת יכולות של מודלי וידאו מבוססי אודיו על גבי LTX-2.3 בקוד פתוח.

איפה זה נופל

המודל תלוי לחלוטין באיכות תמונת הפריים הראשון והקלט הקולי שתספקו לו. הוא אומן 3,000 צעדים בלבד, כך שסגנונות דיבור מורכבים או סביבות רועשות עלולים להישבר, והוא מחייב פורמט פרומפט קשיח ומפוצל לתגיות ויזואליה, דיבור וצלילים כדי לא לסטות מההנחיות.

שאלות
נפוצות

האם הקובץ של ה־1.1 גיגה בייט מספיק כדי לייצר וידאו?

לא. מדובר במשקולות LoRA בלבד, ואתם חייבים להוריד ולהריץ ברקע את מודל הבסיס LTX-2.3 שכולל 22 מיליארד פרמטרים.

האם המודל יודע לדבר עברית בצורה טבעית?

הוא אומן על מאגר TalkVid שרובו באנגלית. לא צוינה תמיכה מפורשת בעברית, ולכן תיאום תנועות השפתיים והאקוסטיקה בעברית דורשים בדיקה מעשית מראש.

איך מריצים

כדי להריץ אותו משתמשים במאגר הרשמי של ID-LoRA, מגדירים את החבילות של גרסה 2.3 ומורידים את מודל הבסיס. הקבצים כאן הם רק מתאם LoRA שדורש את LTX-2.3 המלא של 22 מיליארד פרמטרים, כך שצריך כרטיס מסך חזק עם זיכרון וידאו גבוה, כשהסקריפטים כוללים דגל קוונטיזציה לצמצום העומס.

יש שלושה מסלולי הרצה: שלב יחיד למהירות וחיסכון בזיכרון, שני שלבים שמייצרים ב־512x512 ומבצעים שדרוג רזולוציה ל־1024x1024, ומצב HQ שמקצר את התהליך ל־15 צעדים במקום 30 ומשפר את האיכות בעזרת דוגם Res2s.

pip install -U huggingface_hub
hf download AviadDahan/LTX-2.3-ID-LoRA-TalkVid-3K

הקבצים

5 קבצים במאגר, 1.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ללא פירוט תנאים ברור בעמוד. אי אפשר לדעת אם מותר להשתמש בו מסחרית או להטמיע אותו במוצר בלי לקרוא את תנאי השימוש במאגר המקורי וברישיון של LTX-2.3 עצמו.

הרישיון המלא בעמוד המודל ↗