GPT
I

i2vgen-xl

קוד פתוח

ali-vilabmit2023-12-15

  • diffusers
  • safetensors
  • image-to-video
  • text-to-video

הופך תמונה סטטית יחידה לקטע וידאו ברזולוציה של 1280 על 720 לפי הנחיית טקסט. מיועד למי שרוצה להפיק וידאו מקומי מקוד פתוח עם תמיכה ישירה בספריית diffusers.

  • 1.4Bפרמטרים
  • 27.7 GBמשקל הקבצים
  • 28,541הורדות בחודש
  • 186לייקים

מה זה

מדובר במודל שמקבל תמונה והנחיית טקסט ומייצר מהן וידאו קצר תוך ניסיון לשמור על פרטי הקלט המקורי. הפיתוח מגיע ממעבדת Tongyi של עליבאבא ומתבסס על ארכיטקטורת diffusion מדורגת. הרעיון המרכזי כאן הוא היכולת לייצר פלט ברזולוציה גבוהה של 1280 על 720 ישירות מתמונה אחת, בניגוד לחלק מהמודלים הוותיקים שהסתפקו ברזולוציות נמוכות יותר.

המערכת היא חלק מסביבת VGen הרחבה יותר, שמציעה מודולים שונים לאימון והסקה של וידאו. הגודל שלו עומד על כמעט מיליארד וחצי פרמטרים, מה שמציב אותו בנקודת פשרה סבירה בין יכולת ביטוי לבין זמני ריצה, ומאפשר לו להתחרות בפתרונות מקבילים כמו SVD מהתקופה שבה פורסם.

מתאים ל

  • הנפשת תמונות סטילס

    יצירת סרטוני וידאו קצרים מתמונות קיימות של מוצרים או נופים עבור תוכן שיווקי.

  • מחקר וניסויי וידאו

    בדיקת שיטות אימון והסקה בתוך שלד הקוד של VGen בעזרת ארכיטקטורת diffusion מדורגת.

  • המחשת קונספטים

    הפיכת תמונות שנוצרו במודלים אחרים לסצנות נעות ברזולוציה של 720p לבדיקת רעיונות.

איפה זה נופל

היוצרים מודים שהמודל מתקשה בצורה ברורה עם איורי אנימה ותמונות עם רקע שחור, בגלל מחסור בנתונים כאלה באימון. בנוסף, הוא עדיין מתקשה לשמור על זהות מדויקת של פנים וגוף לאורך תנועות גדולות ומהירות, והתנועה שהוא מייצר עלולה להתעוות. קחו בחשבון גם שאי אפשר להסתמך עליו לטקסטים מורכבים בתוך הסצנה.

שאלות
נפוצות

אפשר לייצר וידאו רק מטקסט בלי תמונה מקדימה?

המודל הספציפי הזה נבנה למשימת תמונה לווידאו, כך שהוא דורש תמונת קלט יחד עם הנחיית הטקסט. אם רוצים יצירה מטקסט בלבד, המאגר VGen כולל מימושים נפרדים כמו HiGen או ModelScope שמיועדים לכך.

האם המודל מבין פרומפטים בעברית?

האימון נעשה כולו באנגלית על בסיס מאגרים בינלאומיים, ולכן הוא לא תומך בעברית. כדי לקבל תוצאות שמתאימות למה שביקשתם, חובה להעביר את כל הנחיות הטקסט באנגלית.

איך מריצים

המודל שוקל 27.7 ג'יגה בייט על הדיסק, כך שהרצה שלו דורשת כרטיס מסך חזק עם זיכרון וידאו משמעותי, לפחות 16 עד 24 ג'יגה בייט בפורמט fp16 כדי לטעון את כל המשקלים ולבצע את החישובים בלי לקרוס.

אפשר להריץ אותו בשתי דרכים: דרך הקוד של VGen ופקודת ה־inference שלהם עם קובץ ההגדרות, או בצורה נקייה ופשוטה יותר דרך diffusers עם I2VGenXLPipeline. תהליך הפקת הווידאו לוקח כמה דקות פר קליפ, כך שאם אתם בונים מוצר שצריך תגובה מהירה למשתמשים, הרצה מקומית תדרוש שרתי GPU ייעודיים ויקרים, ובמקרים כאלה שווה לבחון שירותי ענן.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("ali-vilab/i2vgen-xl")
img = pipe("a photo").images[0]

הרישיון

הרישיון הרשמי בעמוד הוא רישיון MIT, שבאופן עקרוני מתיר שימוש חופשי כולל שימוש מסחרי. אלא שבסוף התיעוד יש הצהרה מפורשת שהמודל אומן על WebVid-10M ועל LAION-400M ומיועד למחקר ולשימוש לא מסחרי בלבד. הסתירה הזו אומרת ששילוב שלו במוצר מסחרי כרוך בסיכון משפטי לא מבוטל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗