GPT
M

MOVA-720p

קוד פתוח

OpenMOSS-Teamapache-2.02026-01-28

  • diffusers
  • safetensors
  • image-to-video
  • image-text-to-video
  • image-to-audio-video

מודל פתוח שמייצר וידאו ברזולוציית 720p יחד עם סאונד מסונכרן בריצה אחת. מתאים למי שרוצה וידאו עם שמע תואם בלי להדביק פתרונות נפרדים.

  • 72.4 GBמשקל הקבצים
  • 299הורדות בחודש
  • 133לייקים

מה זה

במקום לייצר וידאו אילם ואז לנסות להלביש עליו אפקטים קוליים במודל נפרד, המערכת הזו מייצרת את הווידאו והאודיו במקביל. היא מבוססת על שתי רשתות נפרדות, אחת לווידאו ואחת לקול, שמחוברות ביניהן ומחליפות מידע בכל שלב בריצה. אפשר להזין לה טקסט או תמונה, ולקבל וידאו שכולל דיבור עם תנועת שפתיים תואמת או רעשי רקע שמתאימים לתנועה שעל המסך.

המבנה הפנימי נשען על מנגנון מומחים שכולל 32 מיליארד פרמטרים בסך הכל, כשבפועל רק 18 מיליארד פעילים בכל רגע נתון. זה חוסך חלק מעומס החישוב ביחס למודל רגיל בגודל מלא, אבל עדיין מדובר בכובד משקל רציני. החבילה פתוחה לחלוטין וכוללת גם קוד אימון, משקלים ותמיכה בהתאמה מקומית עם לורה.

מתאים ל

  • יצירת קליפים עם דיבור

    הפקת סרטונים קצרים מתמונות או טקסט עם דיבור ותנועת שפתיים תואמת בריצה אחת.

  • הוספת אפקטים לסרטונים

    יצירת וידאו שמכיל צלילי רקע המותאמים ישירות לתנועות ולסביבה שנראות בתמונה.

  • אימון מותאם אישית

    התאמת המודל לסגנון ויזואלי וקולי ספציפי באמצעות סקריפטים של לורה שמגיעים איתו.

איפה זה נופל

הרזולוציה מוגבלת ל־720p, כך שאם הפרויקט שלכם דורש איכות חדה יותר, תצטרכו להוסיף מודל הגדלה נפרד. בנוסף, למרות שהמפתחים מדברים על התאמת שפתיים רב לשונית ואפקטים סביבתיים, לא ברור איך המודל מתמודד עם שפות שלא נפוצות בחומרי האימון כמו עברית, ואין נתונים על קצב יצירת הפריימים בפועל או אורכו המרבי של הווידאו.

שאלות
נפוצות

האם המודל דורש כלי נוסף ליצירת סאונד?

לא. המודל מייצר את הווידאו ואת האודיו באותו מעבר חישובי, כך שהקול כבר מוטמע ומסונכרן עם מה שקורה במסך.

איך אפשר להריץ את המודל בקוד?

הוא עובד עם ספריית diffusers. מורידים את המשקלים מהמאגר ומריצים את הסקריפטים שמופיעים בדף הגיטהאב של הפרויקט.

איך מריצים

המשקלים שוקלים 72.4 ג'יגה בייט בתוך 30 קבצים, וההרצה נשענת על ספריית diffusers. כדי לטעון דבר כזה לזיכרון כרטיס המסך תצטרכו חומרה חזקה מאוד עם נפח זיכרון גרפי נרחב, שרחוק מלהיות זמין במחשב משרדי רגיל.

אם אין לכם שרת ייעודי עם מאיצים מתאימים, אין טעם לנסות להרים את זה מקומית. עדיף להמתין שספקי ענן יציעו גישה מנוהלת או נקודת קצה, כי סנכרון תמונה וקול במקביל תובעני במיוחד בזמן ריצה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("OpenMOSS-Team/MOVA-720p")
img = pipe("a photo").images[0]

הרישיון

הפרויקט משוחרר תחת רישיון אפאצ'י 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר שלכם, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗