GPT
C

CogVideoX-2b

קוד פתוח

zai-orgapache-2.02024-08-05

  • diffusers
  • safetensors
  • cogvideox
  • video-generation
  • thudm

מודל פתוח קומפקטי שמייצר וידאו מטקסט על גבי חומרת קצה נגישה יחסית. הוא מתאים למי שרוצה לבנות אב טיפוס מקומי של יצירת וידאו בלי לשרוף תקציבי ענן ענקיים.

  • 1.7Bפרמטרים
  • 12.8 GBמשקל הקבצים
  • 21,691הורדות בחודש
  • 371לייקים

מה זה

הגרסה הזו מכילה 1.7 מיליארד פרמטרים ומיועדת ליצירת וידאו קצר מתיאור טקסטואלי. היא נבנתה כגרסת כניסה קלה יותר מתוך משפחת המודלים של QingYing, במטרה לאפשר ריצה ופיתוח משני בעלויות נמוכות. הקבצים שוקלים 12.8 גיגה בייט, והיא מתממשקת ישירות עם ספריית diffusers המוכרת בפייתון.

בגודל כזה, הדגש הוא על נגישות חומרתית ולא על איכות שידור קולנועית. המודל מייצר קטעים באורך של 6 שניות בדיוק, בקצב של 8 פריימים לשנייה וברזולוציה קבועה של 720 על 480. במבחני הביצועים הרשמיים, ריצה של 50 צעדים על מעבד A100 יחיד אורכת כ־90 שניות, ועל H100 כ־45 שניות, כך שלא מדובר ביצירה בזמן אמת אלא בתהליך שדורש המתנה מורגשת לכל סרטון.

מתאים ל

  • בדיקת היתכנות מקומית

    פיתוח שרשראות עיבוד ואבות טיפוס של וידאו על חומרה מקומית צנועה לפני התחייבות לשרתי ענן יקרים.

  • מחולל הנפשות פנימי

    יצירת קטעי וידאו קצרים ואוטומטיים באנגלית עבור ממשקים פנימיים שאינם דורשים קצב פריימים גבוה.

  • מחקר והתאמת LoRA

    אימון שכבות LoRA ייעודיות לזיהוי תנועה או סגנונות וידאו ספציפיים תחת רישיון קוד פתוח מתירני.

איפה זה נופל

המגבלה הקשה ביותר היא הנוקשות הטכנית. הפלט מוגבל תמיד לרזולוציה בודדת של 720 על 480 ול־8 פריימים לשנייה, ללא שום תמיכה ברזולוציות אחרות אפילו באימון נוסף. התנועה ב־8 פריימים לשנייה אינה חלקה ונראית מקוטעת. בנוסף, קלט הטקסט מוגבל לעד 226 טוקנים בשפה האנגלית בלבד, כך שטקסט בעברית דורש שכבת תרגום מקדימה. איכות הווידאו עצמה בסיסית בהשוואה לגרסת ה־5B, ושימוש בקוונטיזציה לצורך ריצה על כרטיסים קטנים מאיט את קצב היצירה באופן משמעותי.

אותה משפחה

CogVideoX יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בהנחיות בעברית?

לא. המודל אומן לקבל קלט באנגלית בלבד ועד 226 טוקנים. אם תזינו עברית התוצאות יהיו משובשות, ולכן חובה להעביר את הפרומפט דרך מודל שפה שיתרגם וירחיב אותו לאנגלית לפני השליחה.

האם אפשר להפיק סרטונים באיכות HD או ביחס תמונה מותאם?

לא. המודל נעול ארכיטקטונית לרזולוציה של 720 על 480 פיקסלים ולאורך של 6 שניות ב־8 פריימים לשנייה. יוצרי המודל מדגישים שאין תמיכה ברזולוציות אחרות, גם לא דרך אימון והתאמה אישית.

מה ההבדל המרכזי ברישיון בין גרסת ה־2B לגרסת ה־5B?

גרסת ה־2B משוחררת תחת רישיון Apache 2.0 המתיר שימוש מסחרי מלא וחופשי ללא תנאים מיוחדים. לעומת זאת, גרסת ה־5B משתמשת ברישיון ייעודי ומוגבל של CogVideoX, שמציב תנאים משפטיים שונים על השימוש המסחרי.

איך מריצים

להרצה בסיסית דרך diffusers עם אופטימיזציות פריקה לזיכרון המעבד (CPU offload), צריכת הזיכרון הגרפי מתחילה מ־4 גיגה בייט בלבד ב־FP16, או 3.6 גיגה בייט בשימוש בקוונטיזציה של INT8 דרך TorchAO או quanto. זה אומר שכרטיסים שולחניים צנועים ואפילו T4 חינמי יכולים להריץ אותו להסקה. אם מוותרים על פריקת הזיכרון כדי לקבל מהירות גבוהה פי שלושה, צריכת הזיכרון קופצת למעל 12 גיגה בייט, ובספריית SAT היא מגיעה ל־18 גיגה בייט.

לאימון והתאמה אישית (Fine-tuning) הסיפור שונה לחלוטין. גם עבור LoRA עם גודל אצווה מינימלי של 1, נדרשים 47 גיגה בייט של זיכרון גרפי, ולאימון מלא נדרשים 62 גיגה בייט. לכן, התאמה עצמית מחייבת כרטיסי ענן מקצועיים כמו A100. אם אתם צריכים רק כמה סרטונים בודדים למוצר בלי לתחזק שרת קבוע, שימוש בממשק ענן חיצוני יהיה הגיוני וזול בהרבה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("zai-org/CogVideoX-2b")
img = pipe("a photo").images[0]

הרישיון

רישיון Apache 2.0 מלא וחופשי. הוא מתיר שימוש מסחרי, שינוי קוד, הפצה ושילוב במוצרים סגורים ללא תשלום תמלוגים, בכפוף לשמירה על הצהרת זכויות היוצרים והרישיון המקורי. בניגוד לגרסת ה־5B שמגיעה עם רישיון מוגבל ומותאם אישית, גרסה זו פתוחה לחלוטין למפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗