GPT
L

LongCat-Video-Avatar

קוד פתוח

meituan-longcatmit2025-12-13

  • diffusers
  • onnx
  • safetensors
  • audio-text-to-video
  • audio-image-text-to-video

מודל הנפשת דמויות לפי אודיו שתומך בריבוי דוברים במקביל. הוא מתאים למי שחייב לייצר וידאו של כמה אנשים מדברים מאותו קובץ קול בלי לשבור את המראה שלהם.

  • 120 GBמשקל הקבצים
  • 117הורדות בחודש
  • 260לייקים

מה זה

מדובר במערכת אנימציה מבוססת דיפיוז'ן שמחברת בין קובצי אודיו, טקסט ותמונות כדי לייצר וידאו מדבר. המודל תומך ביצירת וידאו מאודיו וטקסט, מאודיו ותמונה, וגם בהמשך של סרטונים קיימים. הייחוד העיקרי שלו מול פתרונות נפוצים הוא התמיכה המובנית במספר דוברים בו זמנית, לצד יכולת לקבל שני ערוצי שמע נפרדים ברצף או במקביל.

הארכיטקטורה משתמשת בהפרדה בין אותות הדיבור לתנועת הגוף כדי למנוע תנועות רובוטיות, ובמנגנון שמגביל את ההשפעה של תמונת המקור כדי שהדמות לא תיראה קפואה. במבחן EvalTalker שכולל מעל 400 בדיקות לקביעת טבעיות וריאליזם, המודל נמדד מול מודלים קיימים ליצירת אדם בודד ומספר אנשים. בנוסף, יש כאן חיבור ישיר בין מקטעים במרחב הלטנטי שמצמצם את הירידה באיכות שקוראת בדרך כלל בסרטונים ארוכים.

מתאים ל

  • הנפשת שיחות מרובות משתתפים

    יצירת סרטוני פודקאסט או דיאלוגים משני קובצי קול נפרדים, כשהמודל מתזמן מי מדבר ומתי.

  • יצירת אווטארים מדברים מתמונה

    הפיכת תמונת פורטרט קיימת לסרטון דיבור ברזולוציה של עד 720p על בסיס קובץ שמע בודד.

  • הארכת סרטוני וידאו קיימים

    המשך רציף של אנימציית דמות קיימת לכמה מקטעים בלי לאבד את איכות התמונה במעברים.

איפה זה נופל

המודל הזה דורש כוונון ידני עדין מאוד ולא עובד טוב ישר מהקופסה. התיעוד מודה בפירוש שצריך לשחק עם ערכי ה־CFG של האודיו בין 3 ל־5 כדי לקבל סנכרון שפתיים סביר, ושאם לא כותבים בטקסט במפורש שהדמות מדברת, תנועת הפה נפגעת.

בנוסף, יש בעיה מובנית של תנועות שחוזרות על עצמן. כדי לעקוף אותה צריך לשנות ידנית את אינדקס תמונת הרפרנס ואת טווח הפריימים של המסכה, מה שעלול לייצר עיוותים ויזואליים קשים בתמונה. המודל גם מוגבל לרזולוציות של 480p ו־720p בלבד, ומאומן בעיקר על אנגלית וסינית.

שאלות
נפוצות

האם המודל תומך בדיבור בעברית?

הכרטיס מציין תמיכה רשמית באנגלית ובסינית בלבד. אפשר לנסות להזין קובץ קול בעברית לבדיקת תנועת השפתיים, אבל ההנחיות הטקסטואליות חייבות להיות באנגלית והתוצאה עלולה להיות פחות מדויקת.

אפשר להריץ את המודל על כרטיס מסך ביתי יחיד?

לא מומלץ. הקבצים שוקלים 120 גיגה בייט, והדוגמאות הרשמיות דורשות שימוש ב־torchrun עם שני מעבדים גרפיים במקביל לצד FlashAttention-2.

איך מריצים

כדי להריץ אותו תצטרכו להוריד 120 גיגה בייט של משקלים שמחולקים לגרסת דמות בודדת ולגרסת ריבוי דמויות, לצד מודל הבסיס. ההרצה דורשת סביבת פייתון 3.10 עם פייטורץ' 2.6.0, דרייברים מתאימים לקיודה 12.4, והתקנה של FlashAttention-2. סקריפט ההרצה הרשמי משתמש ב־torchrun עם שני מעבדים גרפיים במקביל כברירת מחדל, כך שכרטיס בודד רגיל לא יספיק לכם כאן.

מי שאין לו שרת ייעודי עם לפחות שני כרטיסי מסך חזקים של אנבידיה יתקשה מאוד להרים את זה מקומית. במצב כזה עדיף לחכות שמישהו יעטוף את זה בשירות ענן או API מסחרי, כי ההתעסקות עם התלויות של xformers, ffmpeg וספריות השמע תגזול זמן עבודה יקר.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("meituan-longcat/LongCat-Video-Avatar")
img = pipe("a photo").images[0]

הקבצים

34 קבצים במאגר, 120 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המשקלים והקוד משוחררים תחת רישיון MIT. מותר להשתמש בהם לצרכים מסחריים, לשנות אותם ולשלב אותם במוצר סגור, כל עוד שומרים על הודעת זכויות היוצרים המקורית. הרישיון לא כולל זכויות על סימני מסחר או פטנטים של חברת Meituan.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗