GPT
C

CogVideoX1.5-5B-I2V

קוד פתוח

zai-orgother2024-11-02

  • diffusers
  • safetensors
  • video-generation
  • thudm
  • image-to-video

המודל הופך תמונה יחידה לווידאו של חמש או עשר שניות לפי הנחיית טקסט. הוא מתאים למי שרוצה להנפיש תמונות מקומית בלי לשלם לפי קריאה לשירותים חיצוניים.

  • 5.6Bפרמטרים
  • 28.9 GBמשקל הקבצים
  • 1,870הורדות בחודש
  • 123לייקים

מה זה

מדובר במודל שמקבל תמונת קלט ופרומפט טקסטואלי, ומייצר מתוכם סרטון באורך חמש או עשר שניות בקצב של 16 פריימים לשנייה. הרזולוציה גמישה יחסית, כשהצלע הקצרה קבועה על 768 פיקסלים והארוכה נעה בין 768 ל־1360 פיקסלים, בכפולות של 16.

ההבדל המשמעותי לעומת מחוללי תמונה הוא המורכבות החישובית בזמן ריצה. בבדיקות של המפתחים, יצירת סרטון של חמש שניות ב־50 צעדי דגימה לקחה כ־1000 שניות על כרטיס A100 בודד, וכ־550 שניות על כרטיס H100 בודד, כלומר בין תשע לרבע שעה של חישוב עבור כמה שניות של וידאו.

מתאים ל

  • הנפשת תמונות סטילס

    יצירת קטעי וידאו קצרים של 5 עד 10 שניות מתוך תמונת מקור לפי הנחיה מילולית.

  • עיבוד וידאו באצווה

    מתאים למשימות רקע לא דחופות, שבהן זמן יצירה של עשר דקות לקליפ אינו מהווה חסם.

  • מחקר על מודלי דיפוזיה

    ניסויים ושינויים בארכיטקטורת וידאו פתוחה על חומרה מקומית עם diffusers.

איפה זה נופל

המודל מבין אנגלית בלבד ומקבל עד 224 טוקנים בהנחיה, כך שעבור עברית חייבים לתרגם את הפרומפט מראש. מעבר לזה, זמני הריצה הופכים אותו ללא רלוונטי לכל תרחיש שדורש זמן אמת או מענה מיידי למשתמש. קוואנטיזציה ל־INT8 אמנם מאפשרת לו לרוץ על כרטיסים קטנים כמו T4, אבל הכרטיס מודה בפירוש שהיא גוררת ירידה משמעותית נוספת במהירות הייצור האיטית ממילא.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי?

אפשר לדחוס אותו באמצעות ספריות כמו PytorchAO או Optimum-quanto כדי שיעבוד על פחות זיכרון, אפילו על 9GB. עם זאת, זמני הריצה יהיו ארוכים מאוד וכל סרטון ייקח דקות ארוכות עד שעות.

האם המודל מבין הנחיות בעברית?

לא. המודל תומך רשמית באנגלית בלבד ומוגבל ל־224 טוקנים. אם יש לכם קלט בעברית, תצטרכו להעביר אותו דרך מודל שפה שיתרגם וירחיב אותו לאנגלית לפני השליחה.

איך מריצים

כדי להריץ אותו עם ספריית diffusers נדרש כרטיס מסך של NVIDIA מארכיטקטורת Ampere ומעלה. עם כל אופטימיזציות הזיכרון פועלות, כולל sequential cpu offload, אפשר להסתפק ב־9GB זיכרון וידאו ב־BF16, אבל המחיר הוא איטיות קיצונית. בלי הפריקה למעבד, צריכת הזיכרון משלשת את עצמה אך המהירות עולה פי שלושה עד ארבעה. בריבוי כרטיסים הצריכה מתחילה מ־24GB.

אם אין לכם שרת ייעודי חזק וסבלנות לזמני המתנה ארוכים לכל פריים, עדיף להשתמש ב־API המסחרי שהמפתחים מציעים במקום לתחזק את התשתית הזו בעצמכם.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("zai-org/CogVideoX1.5-5B-I2V")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר כ־other ומפנה לקובץ רישיון ייעודי של CogVideoX. הוא אינו רישיון קוד פתוח סטנדרטי מסוג MIT או אפאצ'י, ואי אפשר להניח שמותר להשתמש בו ישירות במוצר מסחרי בלי לקרוא את תנאי השימוש המדויקים בקובץ המקורי של המפתחים.

הרישיון המלא בעמוד המודל ↗