GPT
S

stable-video-diffusion-img2vid-xt

קוד פתוח

stabilityaiother2023-11-20

  • diffusers
  • safetensors
  • image-to-video

הופך תמונה בודדת לסרטון קצרצר של עשרים וחמישה פריימים. מתאים למי שחייב לייצר תנועה מתמונת מקור מקומית בלי תלות בשירותי ענן סגורים.

  • 1.5Bפרמטרים
  • 30.4 GBמשקל הקבצים
  • 275,300הורדות בחודש
  • 3,396לייקים

מה זה

מדובר במודל דיפוזיה מסוג תמונה לווידאו, שקיבל כוונון עדין מגרסת הבסיס של ארבעה עשר הפריימים כדי לייצר עשרים וחמישה פריימים ברזולוציה של 576 על 1024. הוא מבוסס על קידוד לטנטי וכולל כוונון של מפענח f8 לשמירה על רציפות לאורך ציר הזמן. יחד איתו מופצת גם גרסה עם מפענח רגיל פר פריים.

במבחני העדפת משתמשים מול מערכות מתחרות כמו ג׳ן שתיים ופיקה, בוחנים אנושיים העדיפו את איכות הווידאו שלו. זה אומר שמבחינת חדות ועקביות ויזואלית הוא מספק תוצאה תחרותית מאוד ביחס למודלים סגורים, כל עוד שומרים על מסגרת הזמן הקצרה שהוא הוגדר עבורה.

מתאים ל

  • הנפשת תמונות סטילס

    מייצר תנועת מצלמה קלה מעל תמונה קיימת כשרוצים להפיח בה חיים קצרים.

  • מחקר על מודלי וידאו

    מאפשר לבחון עקביות לאורך זמן והטיות ויזואליות בקוד פתוח.

  • יצירת רקעים לאמנות

    מתאים לאמנים ומעצבים שרוצים לופים קצרים של עשרים וחמישה פריימים.

איפה זה נופל

הסרטונים מוגבלים לארבע שניות או פחות, והמודל רחוק מריאליזם מושלם. אי אפשר לכוון אותו עם הנחיות טקסט, הוא לא יודע לייצר טקסט קריא בתוך הווידאו, ופרצופים או אנשים נוטים להתעוות ולהישבר. בנוסף, המפענח שלו מאבד מידע בתהליך, ולפעמים התוצאה כמעט חסרת תנועה או כוללת רק תזוזת מצלמה איטית מאוד.

שאלות
נפוצות

האם אפשר לשלוט בתנועה של הווידאו באמצעות פרומפט כתוב?

לא. המודל מקבל אך ורק תמונת מקור כקלט ומייצר ממנה את התנועה באופן ישיר. אין לו שום תמיכה בהנחיות טקסט להכוונת הסצנה.

כמה זמן לוקח לייצר סרטון בודד והאם אפשר להריץ אותו מקומית?

על חומרת שרת חזקה כמו כרטיס A100 יצירת קליפ אחד לוקחת בערך שלוש דקות. אפשר להריץ אותו מקומית עם ספריית diffusers, אבל תצטרכו חומרה עם זיכרון גרפי גבוה מאוד כדי להתמודד עם המשקלים והעיבוד.

איך מריצים

משקלי המודל דורשים הורדה של שלושים ג׳יגה בייט בקירוב, והרצה שלו עם הגדרות ברירת המחדל על כרטיס A100 עם שמונים ג׳יגה בייט לוקחת בערך מאה ושמונים שניות לסרטון בודד. אפשר להשתמש בספריית diffusers או בקוד ממאגר generative models הרשמי, עם אופטימיזציות שונות לצמצום זיכרון אם רוצים לרדת לכרטיסים חלשים יותר.

אם אין לכם גישה למאיצים גרפיים חזקים או שזמן עיבוד של שלוש דקות לכל סרטון תוקע לכם את התהליך, החזקה של שרת ייעודי רק בשבילו תהיה יקרה וכבדה מאוד.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("stabilityai/stable-video-diffusion-img2vid-xt")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר כמותאם אישית. הוא פתוח וחינמי למטרות מחקר ושימוש לא מסחרי לפי קובץ הרישיון במאגר, אבל הטמעה במוצר מסחרי מחייבת הפניה לעמוד הרישיונות של החברה והסדרה מולם.

הרישיון המלא בעמוד המודל ↗