GPT
S

stable-video-diffusion-img2vid

קוד פתוח

stabilityaiother2023-11-20

  • diffusers
  • safetensors
  • image-to-video

הופך תמונה בודדת לסרטון קצרצר של 14 פריימים. שווה לבדוק אותו אם אתם מחפשים בסיס פתוח למחקר בווידאו ורוצים איכות תנועה שגוברת על אלטרנטיבות סגורות לפי בדיקות אנושיות.

  • 1.5Bפרמטרים
  • 30.4 GBמשקל הקבצים
  • 80,711הורדות בחודש
  • 1,056לייקים

מה זה

מדובר במודל דיפוזיה מסוג תמונה לווידאו עם 1.5 מיליארד פרמטרים. הוא מקבל תמונת מקור בגודל 576 על 1024 ומייצר ממנה רצף של 14 פריימים באותה הרזולוציה. כדי לשמור על עקביות בין הפריימים בלי שהתמונה תרצד, הכותבים אימנו מחדש מפענח ייעודי, ומספקים גם גרסה עם מפענח רגיל למי שמעדיף.

במבחני העדפה אנושית מול שירותים כמו GEN-2 ו־PikaLabs, בודקים דוברי אנגלית העדיפו את איכות הווידאו שלו. זה מעיד שהתנועה שהוא מייצר מרגישה טבעית יותר מהמתחרים שנבדקו, אבל צריך לזכור שמדובר רק בהנפשה של תמונת בסיס קיימת ולא ביצירה ישירה מטקסט.

מתאים ל

  • מחקר על עקביות בתנועה

    הוא כולל מפענח שעבר התאמה מיוחדת לעקביות זמנית, ולכן הוא בסיס מצוין לבדיקת אלגוריתמים גנרטיביים.

  • הנפשת איורים ואמנות דיגיטלית

    מתאים להפיכת תמונות סטילס לקטעי וידאו קצרים בכלים יצירתיים, כל עוד התוכן לא מתמקד בבני אדם.

  • בדיקת מגבלות של מודלי וידאו

    הכרטיס מכוון אותו לזיהוי הטיות ועיוותים ביצירת וידאו, מה שמקל על מדידת נקודות הכשל שבו.

איפה זה נופל

הווידאו שהוא מייצר קצר מאוד ולא עולה על 4 שניות, והוא רחוק מפוטו-ריאליזם מושלם. אי אפשר לשלוט בו עם טקסט, הוא לא מסוגל לרנדר טקסט קריא בתוך הווידאו, ומפענח התמונה שלו מאבד נתונים בתהליך.

הבעיה העיקרית היא אנשים: הכרטיס מודה מראש שפרצופים ובני אדם עלולים לצאת מעוותים לחלוטין. בנוסף, לא מעט פלטים יוצאים תקועים כמעט בלי שום תנועה, או עם תנועת מצלמה איטית להחריד שלא מוסיפה כלום.

שאלות
נפוצות

אפשר לתת לו הנחיית טקסט כדי להגיד לו מה לעשות?

לא. המודל עובד במצב תמונה לווידאו בלבד. הוא לא מבין פקודות טקסט ומייצר את התנועה על סמך תמונת המקור שהעלתם בלבד.

התוצרים כוללים סימן מים?

כן. קוד ההסקה הרשמי כולל סימן מים ברמת התמונה שמופעל כברירת מחדל באמצעות הספרייה imWatermark, כדי שאפשר יהיה לזהות שהווידאו יוצר במחשב.

האם אפשר לייצר איתו סרטוני וידאו של בני אדם?

עדיף שלא. היוצרים מצהירים בפירוש שהמודל מתקשה בייצור אנשים ופרצופים, ושהוא אינו מתאים לייצוג אמין או עובדתי של דמויות אנושיות.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־30.4 גיגה-בייט, ואתם מריצים אותו דרך ספריית diffusers או המאגר generative-models של החברה. בכרטיס המודל מצוין שריצת הסקה סטנדרטית דורשת כ־100 שניות על מעבד גרפי חזק מסוג A100 עם 80 גיגה זיכרון.

אם אין לכם חומרה ייעודית כבדה בענן, להריץ אותו מקומית יהיה איטי מאוד או ידרוש אופטימיזציות זיכרון שיפגעו באיכות. לניסויים מהירים או מוצר אמיתי, עדיף להשתמש בפתרון ענן מוכן ולא לתחזק שרת כזה לבד.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("stabilityai/stable-video-diffusion-img2vid")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר כ־other והמודל מיועד למחקר בלבד. שימוש מסחרי מותנה ברכישת רישיון נפרד באתר החברה ובכפוף למדיניות השימוש שלה. אי אפשר לקחת את המשקלים ולשלב אותם באפליקציה מסחרית בלי לפנות אליהם קודם.

הרישיון המלא בעמוד המודל ↗