GPT
M

MeiGen-MultiTalk

קוד פתוח

MeiGen-AIapache-2.02025-06-09

  • diffusers
  • safetensors
  • video generation
  • conversational video generation
  • talking human video generation

מודל תמונה לווידאו שמייצר דיאלוגים מרובי משתתפים מסונכרני שפתיים לפי אודיו. הוא מיועד למי שצריך להנפיש שיחה בין כמה דמויות באותו פריים ולא רק ראש מדבר בודד.

  • 75.1 GBמשקל הקבצים
  • 8,385הורדות בחודש
  • 198לייקים

מה זה

רוב הכלים בתחום סנכרון השפתיים מוגבלים לאדם יחיד שמביט ישירות למצלמה. כאן בנו ארכיטקטורה שמסוגלת לקחת תמונת מקור של כמה אנשים, קבצי שמע של הדוברים, וליצור סרטון של עד 15 שניות שבו כל דמות מזיזה את השפתיים בזמן המתאים לה. החידוש הטכני שלהם נקרא L-RoPE, והוא מצמיד תוויות דומות לקטעי הקול ולאזורים בווידאו כדי שהקול לא יתחבר בטעות לדמות הלא נכונה בפריים.

בנוסף לשיחות ריאליסטיות, הוא יודע לעבוד עם דמויות מצוירות ולהתמודד עם שירה. הפלט גמיש למדי מבחינת יחסי תצוגה ברזולוציות של 480p ו־720p, ונשען על ספריית diffusers להרצה. עם זאת, הוא מתמקד באנגלית ובסינית בלבד, כך שלא בטוח איך תנועות הפה יתמודדו עם הגייה בשפות אחרות.

מתאים ל

  • הנפשת שיחות מרובות משתתפים

    יצירת סרטוני דיאלוג בין שתי דמויות או יותר מתוך תמונה אחת ורצועות שמע נפרדות.

  • הנפשת דמויות מצוירות שרות

    חיבור קטעי שירה לאיורים כדי להפיק סרטוני מוזיקה קצרים באנימציה.

  • סרטוני הדרכה עם אווטארים

    הפקת סרטונים קצרים של עד 15 שניות ברזולוציה מותאמת עבור הדרכות ורשתות חברתיות.

איפה זה נופל

הסרטון מוגבל לעד 15 שניות בלבד, כך שזה לא מתאים להפקות ארוכות בלי לחתוך ולחבר קטעים ידנית. הרזולוציה המרבית היא 720p, מה שפחות מתאים לפרויקטים שדורשים איכות שידור גבוהה. בנוסף, התמיכה המוצהרת היא באנגלית ובסינית, ואין נתונים על התנהגות המודל עם שפות שמיות או עברית.

שאלות
נפוצות

האם אפשר לייצר סרטון ארוך מדקה?

לא באופן ישיר. המודל מוגבל מראש לאורך מרבי של 15 שניות בכל הרצה. כדי ליצור סרטון ארוך יותר תצטרכו לייצר מקטעים נפרדים ולערוך אותם יחד בתוכנת עריכה.

איך המודל יודע איזה קול שייך לכל דמות בתמונה?

הוא משתמש במנגנון שנקרא L-RoPE יחד עם איתור דמויות אדפטיבי. השיטה מחשבת דמיון בין אזור הדמות בתמונה לבין רצועת השמע, כדי למנוע מצב שבו דמות אחת מדברת בקול של השנייה.

איך מריצים

המשקל הכולל של הקבצים עומד על 75.1 ג'יגה בייט שמתפרסים על 17 קבצים שונים. זה אומר שאתם צריכים מאיץ גרפי חזק מאוד עם נפח זיכרון מכובד כדי לטעון ולהריץ אותו מקומית, רצוי כרטיס ברמת שרתים ולא כרטיס ביתי פשוט.

ההתקנה מתבצעת דרך diffusers והקוד בגיטהאב של הפרויקט. אם אין לכם תשתית ענן ייעודית עם כרטיסי A100 או מקבילים, ההורדה וההרצה של חבילה כזו תהיה כבדה ויקרה מדי, ועדיף להמתין שמישהו יציע אותו כנקודת קצה מנוהלת.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("MeiGen-AI/MeiGen-MultiTalk")
img = pipe("a photo").images[0]

הרישיון

רישיון apache-2.0 מלא. אתם יכולים להשתמש בו באופן חופשי לצרכים פנימיים או מסחריים, לשנות את הקוד ולהפיץ אותו, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון. היוצרים מצהירים שאינם טוענים לזכויות על התוכן שנוצר, אך מטילים עליכם את האחריות שלא לייצר תוכן פוגעני או כזה שמפר חוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗