GPT
L

LongCat-Video-Avatar-1.5

קוד פתוח

meituan-longcatmit2026-05-21

  • longcat-video-avatar-1.5
  • onnx
  • diffusers
  • safetensors
  • audio-text-to-video

המודל הזה מייצר וידאו של דמויות מדברות על בסיס קול ותמונה. הוא נותן פתרון פתוח שמתמקד בסנכרון שפתיים מדויק וריצה מהירה במיוחד של שמונה צעדים בלבד.

  • 69.7 GBמשקל הקבצים
  • 1,792הורדות בחודש
  • 773לייקים

מה זה

מדובר במודל שמקבל אודיו, תמונה וטקסט, ומייצר מהם סרטון וידאו של דמות מדברת, שרה או מנהלת שיחה. בגרסה הזו החליפו את מקודד הקול הישן ב־Whisper-Large, מה שמייצר תנועת שפתיים חלקה וטבעית יותר. מעבר לדמויות בודדות, הוא תומך בהזנה של שני ערוצי שמע שונים במקביל או בזה אחר זה כדי לייצר אינטראקציה בין שתי דמויות באותו פריים.

במקום תהליך יצירה ארוך של עשרות צעדים, המודל עבר זיקוק שמקצר את הדגימה לשמונה צעדי חישוב. לפי הערכת המפתחים שנבדקה מול 770 מעריכים ומומחים בתחום, הוא שומר על יציבות של הגוף כולו לאורך זמן ולא מעוות את תווי הפנים של הדמות המקורית, גם במעבר לסגנונות כמו אנימציה או חיות.

מתאים ל

  • הנפשת תמונות מאודיו קיים

    יצירת סרטון מבוסס קובץ קול ותמונת פנים בודדת בשמונה צעדי חישוב בלבד.

  • סרטוני דיאלוג לשתי דמויות

    תמיכה מובנית בחיבור שני ערוצי שמע שונים כדי לייצר שיחה בין שתי דמויות באותו פריים.

  • הנפשת דמויות מצוירות

    יכולת הכללה לסגנונות אנימציה ודמויות שאינן אנושיות תוך שמירה על עקביות תווי הפנים.

איפה זה נופל

השליטה במודל דורשת התעסקות עדינה בהגדרות ידניות. תנועות חוזרות ונשנות של הדמות הן בעיה מוכרת, וכדי לעקוף אותה המפתחים ממליצים לשחק עם אינדקס תמונת הייחוס ולהגדיל את טווח הפריימים של המסכה, מה שעלול לייצר עיוותים ויזואליים אם מגזימים. בנוסף, סנכרון השפתיים תלוי בערך מנחה שצריך לכוונן ידנית. המודל נבדק רק על אנגלית וסינית, כך שביצועים בעברית אינם מובטחים ולא נבדקו, וטקסטים קצרים מדי בפרומפט פוגעים מיד באיכות התנועה והעקביות.

שאלות
נפוצות

האם המודל תומך בדיבור בעברית?

הכרטיס מציין רשמית תמיכה באנגלית ובסינית בלבד, והערכות האיכות בוצעו על שפות אלו. מקודד האודיו מבוסס על Whisper שתומך בעברית, כך שהמודל עשוי להגיב לקול בעברית, אך תנועות הפה לא נבדקו וייתכן שיהיו פחות מדויקות.

כמה זיכרון וידאו צריך כדי להריץ אותו?

דף המודל אינו מציין נפח VRAM מדויק בג'יגה בייט, אך קובצי המודל שוקלים קרוב ל־70 ג'יגה בייט והוא דורש גם את מודל הבסיס. פקודת ההרצה הרשמית מוגדרת לשני כרטיסים גרפיים במקביל וכוללת אפשרות לכימות INT8 כדי להצליח להיכנס לזיכרון.

למה צריך פרומפטים ארוכים אם יש כבר קובץ קול?

היוצרים מציינים במפורש שטקסט קצר מדי פוגע בטבעיות של הדמות. המודל זקוק לתיאור מפורט של מראה האדם, התנועות שלו והסביבה כדי לייצר תנועה עקבית ולא לחזור על אותן מחוות שוב ושוב.

איך מריצים

כדי להריץ אותו בפועל תצטרכו להוריד קבצים במשקל כולל של כמעט שבעים ג'יגה בייט, ובנוסף להוריד בנפרד את מודל הבסיס LongCat-Video. ההרצה דורשת סביבת לינוקס, פייתון 3.10, PyTorch 2.6 עם תמיכת CUDA וספריית FlashAttention. תסריט ההרצה הרשמי מבוסס על torchrun ומחלק את העבודה בין שני מעבדים גרפיים במקביל דרך Context Parallel.

גרסה 1.5 מחייבת הפעלה של מצב הזיקוק, ותומכת גם בכימות של DiT ל־INT8 כדי לחסוך בזיכרון גרפי. זה לא מודל שרץ על מחשב נייד או כרטיס ביתי בסיסי. אם אין לכם שרת ייעודי עם שני כרטיסים חזקים עתירי VRAM, כנראה שתעדיפו להמתין לשירותי ענן שיארחו אותו בעבורכם.

pip install -U huggingface_hub
hf download meituan-longcat/LongCat-Video-Avatar-1.5

הקבצים

57 קבצים במאגר, 69.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המשקלים והקוד משוחררים ברישיון MIT מלא. אתם רשאים להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במוצרים שלכם בלי תשלום תמלוגים, כל עוד אתם שומרים על הודעת הרישיון המקורית. הרישיון לא מעניק זכויות בסימני מסחר או פטנטים של חברת Meituan.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗