GPT
T

text-to-video-ms-1.7b

קוד פתוח

ali-vilabcc-by-nc-4.02023-03-22

  • diffusers
  • safetensors
  • text-to-video

מודל פתוח מוקדם ליצירת וידאו מטקסט, שרץ ישירות דרך ספריית diffusers. הוא מעניין בעיקר למי שרוצה לבדוק יצירת וידאו מקומית על כרטיס מסך ביתי בלי תלות בשירותים חיצוניים.

  • 1.4Bפרמטרים
  • 20.5 GBמשקל הקבצים
  • 8,514הורדות בחודש
  • 681לייקים

מה זה

מדובר במודל דיפוזיה שמקבל טקסט ומייצר רצף פריימים של וידאו. הארכיטקטורה שלו מבוססת על שלושה שלבים: חילוץ מאפיינים מהטקסט, דיפוזיה במרחב לטנטי באמצעות רשת UNet3D, והמרה חזרה מהמרחב הלטנטי לווידאו עצמו. המשקל הכולל יושב על כ־1.4 מיליארד פרמטרים בפועל, למרות שבשם מופיע 1.7B.

הוא אומן על מאגרי מידע ציבוריים מוכרים כמו Webvid, LAION5B ו־ImageNet שעברו סינון לפי ציוני אסתטיקה וסימני מים. בזכות השילוב עם diffusers של Hugging Face קל לשלב אותו בקוד קיים, אבל צריך לזכור שהוא יצא בתחילת 2023 ומיועד להדגמת היתכנות ומחקר יותר מאשר להפקה שדורשת דיוק גבוה.

מתאים ל

  • מחקר והדגמות יצירת וידאו

    הוא נתמך ישירות ב־diffusers ומאפשר לבחון דיפוזיה של וידאו מקומית על חומרה צנועה יחסית.

  • פרוטוטייפים מקומיים

    בדיקת אינטגרציה לפייפליין של text-to-video באנגלית בסביבת פיתוח פנימית וללא עלויות ענן.

  • יצירת סרטוני אנימציה קצרים

    הפקת סרטונים קצרים של תנועות בסיסיות מתיאור טקסטואלי, כשאין דרישה לריאליזם של בני אדם.

איפה זה נופל

האיכות רחוקה מאוד מרמה קולנועית. המודל לא יודע לייצר טקסט קריא בתוך הווידאו, ומתקשה בהוראות מורכבות שדורשות שילוב של כמה אלמנטים יחד. הוא תומך באנגלית בלבד, כך שטקסט בעברית פשוט לא יעבוד. בנוסף, המפתחים מציינים שהוא לא מתאים לתיאור ריאליסטי של אנשים או אירועים, וקובץ ה־mp4 שנוצר מקודד בצורה שלא כל נגן מדיה יודע לפתוח, אלא דורש לרוב שימוש ב־VLC.

שאלות
נפוצות

האם המודל מבין פרומפטים בעברית?

לא. המודל אומן על קורפוס באנגלית ותומך באנגלית בלבד. אם תזינו עברית, תקבלו תוצאות שגויות או רעש אקראי.

האם אפשר להשתמש בו במוצר מסחרי?

לא, הרישיון המוגדר הוא CC לשימוש לא מסחרי בלבד. כדי להכניס כלי כזה למוצר שמניב הכנסות, תצטרכו לחפש מודל עם רישיון מסחרי פתוח כמו אפאצ'י או MIT.

איזה כרטיס מסך אני צריך בפועל כדי לייצר סרטון?

הקבצים שוקלים 20.5GB, אבל עם אופטימיזציות של חיתוך VAE ו־CPU offload אפשר להריץ אותו על כרטיס מסך עם פחות מ־16GB VRAM. בלי הטכניקות האלה תיתקלו בשגיאות זיכרון כמעט מיד.

איך מריצים

המשקלים שוקלים 20.5GB ב־23 קבצים, והקוד הרשמי רץ בעזרת ספריית diffusers, transformers, accelerate ו־torch. כדי לחסוך זיכרון ולהריץ אותו על פחות מ־16GB של VRAM, חייבים להפעיל CPU offload ולחתוך חישובי VAE ו־attention דרך הפונקציות הייעודיות של diffusers. עם האופטימיזציות האלה ושימוש ב־Torch 2.0 אפשר לייצר סרטונים ארוכים של עד 200 פריימים, שזה בערך 25 שניות.

אם אין לכם כרטיס מסך עם לפחות 16GB זיכרון או שאתם מחפשים קצב יצירה מהיר, אין טעם להיאבק עם חומרה מקומית חלשה. עדיף לפנות ל־API בענן שמשתמש בחומרה ייעודית, במיוחד כשתהליך ההסקה לוקח 25 צעדים של דיפוזיה לכל סרטון.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("ali-vilab/text-to-video-ms-1.7b")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא cc-by-nc-4.0 (ובגוף הטקסט נזכר גם CC-BY-NC-ND). המשמעות חותכת: השימוש הוא למטרות מחקר בלבד, ואסור לכל שימוש מסחרי. אי אפשר לשלב אותו במוצר שמייצר הכנסה, וכל הפצה מחדש דורשת מתן קרדיט מלא ליוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗