GPT
C

CogVideoX-5b

קוד פתוח

zai-orgother2024-08-17

  • diffusers
  • safetensors
  • cogvideox
  • video-generation
  • thudm

המודל מייצר סרטוני וידאו קצרים מטקסט באיכות גבוהה יחסית למשקלו. הוא מתאים למי שרוצה להריץ מחולל וידאו עצמאי בקוד פתוח בלי להסתמך על שירותים סגורים.

  • 5.6Bפרמטרים
  • 20.1 GBמשקל הקבצים
  • 14,663הורדות בחודש
  • 687לייקים

מה זה

מדובר בגרסת 5.6 מיליארד פרמטרים שנועדה ליצירת וידאו ישירות מתיאור טקסטואלי, המבוססת על המערכת המסחרית QingYing. בהשוואה לגרסת ה־2B הקטנה יותר, המודל הזה משתמש בקידוד מיקום מסוג 3d_rope במקום sincos, ומספק איכות תמונה ותנועה גבוהות יותר על חשבון זמן חישוב כפול.

התוצר שהוא מפיק קבוע לחלוטין: סרטון באורך 6 שניות, בקצב של 8 פריימים לשנייה, וברזולוציה של 720 על 480 פיקסלים. אין כאן גמישות במידות הפלט או באורך, והמערכת מקבלת טקסט באנגלית בלבד עד לאורך של 226 טוקנים. אם יש לכם צורך בשפות אחרות, תצטרכו לתרגם אותן קודם בעזרת מודל שפה נפרד.

מתאים ל

  • יצירת הדגמות וידאו קצרות

    מתאים להפקת קליפים של 6 שניות מפרומפטים מפורטים באנגלית, כשאין צורך ברזולוציה גבוהה מ־480p.

  • ניסויי מחקר מקומיים

    אפשרות נוחה לבדיקת מודלי דיפוזיה של וידאו על חומרה ביתית או T4 תודות לדחיסה ל־INT8.

  • מחקר התאמות אישיות

    המודל תומך ב־LoRA ואימון מלא, למי שמחזיק כרטיסי A100 של 80GB ורוצה לאמן סגנון ייחודי.

איפה זה נופל

הפלט מוגבל בקשיחות לרזולוציה בודדת של 720x480, ללא אפשרות לשנות גודל אפילו באימון נוסף. קצב של 8 פריימים לשנייה יוצר תנועה שאינה חלקה לחלוטין, וזמן הריצה ארוך מאוד ומגיע למספר דקות לסרטון בודד על חומרה חזקה. בנוסף, המודל אינו מבין עברית או שפות אחרות פרט לאנגלית, ומחייב מעקף של תרגום מראש.

אותה משפחה

CogVideoX יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי?

כן, באמצעות ספריית diffusers ושילוב של דחיסת INT8 או חלוקת עומסים לזיכרון המחשב, צריכת זיכרון הווידאו יורדת סביב 4.4GB עד 5GB. החיסרון הוא שזמן היצירה יתארך משמעותית ביחס לכרטיסי שרת.

האם המודל מקבל הנחיות בעברית?

לא, המודל מאומן לקבל קלט באנגלית בלבד. אם תזינו טקסט בעברית התוצאות יהיו משובשות, ולכן חובה להעביר את הטקסט תרגום לאנגלית לפני הפנייה למודל.

איך מריצים

בפועל אפשר להריץ אותו דרך ספריית diffusers עם תמיכה ב־BF16. המפתחים בדקו אותו על כרטיסי A100 ו־H100, כאשר על גבי A100 בודד יצירת סרטון ב־50 צעדים לוקחת בערך 180 שניות, ועל H100 כ־90 שניות. בריצת ברירת מחדל במסגרת SAT תצטרכו 26GB של זיכרון כרטיס מסך, אך באמצעות אופטימיזציות כמו cpu offload ודחיסה ל־INT8 עם TorchAO אפשר לרדת עד לצריכת זיכרון מינימלית של כ־4.4GB או 5GB ב־BF16, מה שמאפשר להריץ אותו אפילו על כרטיס T4 בסיסי.

אם אתם צריכים לאמן או לעשות fine-tuning, החומרה הופכת לכבדה בהרבה, החל מ־63GB ל־LoRA ועד 75GB לאימון מלא. במקרים שבהם אין לכם כרטיסי שרת ייעודיים וזמן יצירה של שלוש דקות לסרטון בודד הוא איטי מדי עבורכם, פנייה ישירה ל־API המסחרי של הפרויקט תהיה זולה ופשוטה יותר מהרמת תשתית עצמאית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("zai-org/CogVideoX-5b")
img = pipe("a photo").images[0]

הרישיון

הרישיון מוגדר כמותאם אישית תחת השם CogVideoX LICENSE, ולא כרישיון קוד פתוח סטנדרטי כמו MIT או Apache. תנאי השימוש המסחריים הספציפיים וההגבלות שלו מנוהלים בקובץ הרישיון של המאגר, ולכן חובה לקרוא אותו ישירות כדי לוודא אם המוצר שלכם עומד בדרישות ההפצה.

הרישיון המלא בעמוד המודל ↗