GPT
L

LatentSync-1.5

קוד פתוח

ByteDanceopenrail++2025-03-14

  • torchgeo
  • lipsync
  • video-editing

פתרון לסנכרון שפתיים בווידאו לפי קובץ שמע, שמתקן קפיצות תנועה בין פריימים. שווה לבדוק אותו אם אתם עובדים עם סרטונים בסינית או מחפשים מודל שאפשר לאמן על כרטיס ביתי.

  • 9.1 GBמשקל הקבצים
  • 43,608הורדות בחודש
  • 90לייקים

מה זה

מדובר במודל שמתאים תנועת שפתיים בווידאו קיים לקובץ סאונד נתון. בגרסה הזו המפתחים החזירו שכבה זמנית (temporal layer) שבעבר חשבו שהורסת את הדיוק, אבל גילו שמדובר היה בבאג בקוד. התוצאה בפועל היא וידאו הרבה יותר יציב לאורך זמן, בלי הריצודים המעצבנים סביב הפה שהיו בגרסה 1.0.

בנוסף, הכניסו כאן דאטה חדש כדי לפתור בעיות דיוק קשות שהיו בסרטונים בשפה הסינית. הקוד נשען על diffusers בגרסה 0.32.2 ונפטר מתלויות מעיקות כמו xFormers ו־Triton לטובת FlashAttention-2 המובנה של PyTorch, מה שהופך את התחזוקה והשילוב בסביבות עבודה לנגישים בהרבה.

מתאים ל

  • דיבוב סרטונים לסינית

    אימון המודל כלל תוספת ייעודית של דאטה בסינית, כך שהוא מתאים במיוחד לסנכרון שפתיים בשפה זו.

  • אימון והתאמה אישית

    צריכת הזיכרון בשלב השני צומצמה ל־20 גיגה בייט, מה שמאפשר לכוונן אותו על חומרה כמו RTX 3090.

  • סרטונים עם תנועה רציפה

    שילוב שכבת הזמן בקוד המתוקן מפחית עיוותים וקפיצות בין פריימים לאורך הווידאו.

איפה זה נופל

הגרסה הזו נולדה בגלל תלונות של משתמשים על ביצועים גרועים במיוחד בסרטונים בסינית, מה שמראה שהמודל לא תמיד מתמודד טוב עם כל שפה או סגנון דיבור מהקופסה. לא ברור איך הוא מתנהג עם שפות מורכבות אחרות כמו עברית, שכן אין עליהן מידע בחומר. בנוסף, אף על פי שצריכת הזיכרון אופטימזציה לאימון, דרישת 20 גיגה בייט של VRAM לשלב השני עדיין משאירה מפתחים עם כרטיסים גרפיים פשוטים בחוץ.

שאלות
נפוצות

האם אפשר לאמן את המודל על כרטיס מסך ביתי?

כן, בתנאי שיש לכם כרטיס חזק עם מספיק זיכרון. בזכות אופטימיזציות כמו מעבר ל־FlashAttention-2 ואימון שכבות ספציפיות בלבד, שלב האימון השני דורש כעת 20 גיגה בייט של VRAM ונתמך רשמית על RTX 3090 בודד.

מה ההבדל העיקרי מול גרסה 1.0?

השינוי המשמעותי ביותר הוא תיקון באג שהחזיר את שכבת הזמן לפעולה, מה שמייצר עקביות תנועה טובה בהרבה בין הפריימים. בנוסף, המודל אומן על מידע חדש כדי לשפר את הביצועים בסרטונים בסינית, והקוד נוקה מתלויות כמו xFormers.

איך מריצים

המשקל הכולל של הקבצים עומד על 9.1 גיגה בייט, כך שתצטרכו כרטיס סביר רק כדי לטעון אותו לזיכרון. הבשורה הגדולה כאן היא דווקא באימון שלב שני (stage2): המפתחים הורידו את צריכת ה־VRAM ל־20 גיגה בייט באמצעות gradient checkpointing ואימון ממוקד של שכבות הזמן ותשומת הלב של השמע בלבד.

זה אומר שאפשר לאמן אותו מקומית על כרטיס בודד כמו RTX 3090 בלי לפשוט רגל בענן. אם המטרה היא רק להריץ הסקה נקודתית בלי לגעת במשקלים, חומרה צנועה יותר עשויה להספיק, אבל למי שאין תשתית GPU זמינה עדיף לחפש שירות מנוהל או API מבוסס ענן במקום להסתבך עם התקנות מקומיות.

pip install -U huggingface_hub
hf download ByteDance/LatentSync-1.5

הרישיון

הפרויקט מופץ תחת רישיון openrail++. הרישיון הזה מתיר שימוש חופשי כולל שימוש מסחרי ברוב המקרים, אבל כולל הגבלות אתיות מפורשות לגבי מטרות השימוש, כמו איסור על יצירת תוכן מטעה או שימוש פוגעני. לפני שאתם משלבים אותו במוצר מסחרי, חובה לקרוא את רשימת ההגבלות ולוודא שהיישום שלכם עומד בהן.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗