GPT
C

CogVideoX-5b-I2V

קוד פתוח

zai-orgother2024-09-16

  • diffusers
  • safetensors
  • cogvideox
  • video-generation
  • thudm

הנפשת תמונות סטילס לווידאו קצר באמצעות פקודת טקסט באנגלית. הוא נותן איכות ויזואלית טובה מהגרסאות הקטנות יותר ורץ גם בחומרה נגישה יחסית תחת אופטימיזציות זיכרון.

  • 5.6Bפרמטרים
  • 20.2 GBמשקל הקבצים
  • 12,291הורדות בחודש
  • 321לייקים

מה זה

מדובר במודל שמקבל תמונת קלט ופרומפט טקסטואלי, ומייצר מהם סרטון באורך שש שניות בקצב של שמונה פריימים לשנייה. בניגוד לגרסת הטקסט לווידאו המקבילה, שולבו כאן שכבות מיקום ייעודיות להתמודדות עם עוגן חזותי קבוע.

הוא מבוסס על חמישה וחצי מיליארד פרמטרים ומציג שיפור באיכות הוויזואלית לעומת גרסת ה־2B. השיפור הזה מגיע עם מחיר ברור בזמני הריצה. אם בגרסה הקטנה רינדור לוקח כארבעים וחמש שניות על H100, כאן אותה משימה ב־50 צעדים דורשת תשעים שניות מלאות, או שלוש דקות שלמות על כרטיס A100 בודד.

מתאים ל

  • הנפשת תמונות מוצר

    הפיכת תמונת סטילס בודדת לסרטון קצר של שש שניות להצגה באתרי מסחר.

  • יצירת רקעים חיים למשחקים

    הנפשת איורי רקע או דמויות סטטיות בלולאה קצרה לצורך אב טיפוס מהיר.

  • מחקר והתאמה מקומית ב־LoRA

    אימון שכבות קלות על כרטיס בודד של 80GB לצורך התאמת סגנון ויזואלי ייחודי.

איפה זה נופל

המגבלה הבולטת ביותר היא הרזולוציה. המודל נעול לחלוטין על 720 על 480 פיקסלים, ואין שום תמיכה ברזולוציות אחרות, אפילו לא דרך כוונון עדין. הווידאו מוגבל לשש שניות בלבד ובקצב נמוך של 8 פריימים לשנייה, כך שתנועות מהירות עשויות להיראות קטועות. בנוסף, טקסט הקלט חייב להיות באנגלית עד 226 טוקנים. אין שום הבנה מובנית של עברית, וכל ניסיון להזין שפה אחרת מחייב תרגום מוקדם באמצעות מודל שפה נפרד.

שאלות
נפוצות

האם אפשר לייצר סרטונים ברזולוציית HD מלאה?

לא. המודל תומך אך ורק ברזולוציה קבועה של 720 על 480 פיקסלים. לא ניתן לשנות את היחס או הגודל בהגדרות, והמפתחים מציינים שגם כוונון עדין אינו תומך במידות אחרות.

האם כרטיס מסך ביתי עם 8GB VRAM יספיק להרצה?

כן, בתנאי שמשתמשים בספריית diffusers יחד עם דחיסת INT8 וטכניקות של sequential cpu offload. במצב זה צריכת הזיכרון יורדת לכ־4.4GB, אך זמני הייצור יהיו ארוכים מאוד ביחס לכרטיסי שרת.

איך מריצים

איסוף הקבצים דורש הורדה של כעשרים ג'יגהבייט, והרצה נקייה ב־BF16 בלי התאמות צורכת 26 ג'יגהבייט של זיכרון וידאו. עם זאת, שילוב של diffusers יחד עם פריקה רציפה למעבד, חיתוך VAE ודחיסה ל־INT8 מאפשר להוריד את צריכת הזיכרון ל־4.4 ג'יגהבייט, מה שפותח אפשרות להריץ אותו אפילו על כרטיסי T4 חינמיים.

המחיר של הטריקים האלה הוא קצב עיבוד איטי משמעותית. אם אתם מתכננים שירות בזמן אמת, הרצה מקומית איטית מדי כאן. אימון עדין מלא דורש חומרה כבדה מאוד, לפחות שמונה כרטיסי H100 עם 75 ג'יגהבייט זיכרון פנוי לכרטיס, כך שלרוב הצוותים יהיה זול והגיוני יותר לפנות ל־API חיצוני.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("zai-org/CogVideoX-5b-I2V")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר כ־other ומפנה למסמך פנימי של הפרויקט בשם CogVideoX LICENSE. לפני שאתם מטמיעים אותו במוצר מסחרי, חובה לפתוח את קובץ הרישיון המקורי במאגר ולבדוק את תנאי ההפצה וההגבלות על שימוש מסחרי, שכן לא מדובר ברישיון קוד פתוח סטנדרטי.

הרישיון המלא בעמוד המודל ↗