GPT
M

modelscope-damo-text-to-video-synthesis

קוד פתוח

ali-vilabcc-by-nc-4.02023-03-19

  • open_clip
  • text-to-video

מודל דיפוזיה שמייצר סרטוני וידאו קצרים מטקסט באנגלית. הוא מעניין בעיקר למי שרוצה לבדוק יצירת וידאו מקומית על החומרה שלו בלי לשלם על שירותי ענן סגורים.

  • 13.8 GBמשקל הקבצים
  • 181הורדות בחודש
  • 489לייקים

מה זה

המודל כולל כ־1.7 מיליארד פרמטרים ומורכב משלוש תת־רשתות, חילוץ מאפייני טקסט, מודל דיפוזיה במרחב הלטנטי שמבוסס על מבנה Unet3D, ותרגום מהמרחב הלטנטי לווידאו סופי. התהליך מתחיל מרעש גאוסיאני ומנקה אותו בהדרגה עד שמתקבל קובץ וידאו התואם את התיאור. המודל אומן על מערכי נתונים ציבוריים מוכרים כמו Webvid, LAION5B ו־ImageNet, ועבר סינון לפי ציוני אסתטיקה וזיהוי סימני מים.

בניגוד למודלים שמייצרים תמונות בודדות, המודל הזה מתמודד עם ציר הזמן. הוא מיועד למחקר ומאפשר להזין תיאורים חופשיים באנגלית בלבד ולקבל קובץ וידאו מקודד, שמפתחי המודל מציינים שמומלץ לפתוח אותו בנגן VLC כדי להימנע מבעיות תאימות.

מתאים ל

  • מחקר בתחום יצירת וידאו

    קוד פתוח עם ארכיטקטורת Unet3D שמאפשר לנתח תהליכי דיפוזיה מרעש גאוסיאני לציר זמן.

  • בדיקת היתכנות מקומית

    בדיקת יכולות יצירת וידאו על כרטיס מסך עם 16 גיגה זיכרון בלי להסתמך על ספקי צד שלישי.

  • יצירת הדגמות קונספט

    הפקת קטעי וידאו קצרים ולא מלוטשים מטקסט באנגלית עבור הדמיות רעיוניות מהירות.

איפה זה נופל

זה לא כלי שמייצר וידאו באיכות קולנועית, והמפתחים מודים בזה במפורש. הוא מתקשה מאוד במשימות הרכבה מורכבות, נכשל בניסיון להציג טקסט קריא בתוך הווידאו, ומציג סטיות שנובעות מהתפלגות המידע במערכי האימון כמו Webvid.

בנוסף, המודל לא אומן לייצג אנשים או אירועים באופן מציאותי, כך שלא כדאי לבנות עליו לסצנות אנושיות אמינות. אין שום תמיכה בעברית או בשפות אחרות מלבד אנגלית, והקלט מוגבל למשפטים קצרים.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב בלי כרטיס מסך ייעודי?

לא. המודל דורש במפורש הרצה על גבי כרטיס מסך בלבד, עם מינימום של 16 גיגה־בייט זיכרון וידאו. הרצה על גבי המעבד הרגיל אינה נתמכת בקוד הקיים.

האם ניתן להזין תיאורים בעברית?

לא, המודל אומן על מאגרי נתונים באנגלית ותומך אך ורק בקלט בשפה זו. הזנה של שפות אחרות לא תניב תוצאות תקינות.

האם מותר לי לשלב את המודל באפליקציה בתשלום?

ממש לא. המודל מופץ תחת רישיון cc-by-nc-4.0 שמגביל את השימוש למטרות שאינן מסחריות בלבד, כך שכל יישום רווחי מפר את תנאי הרישיון.

איך מריצים

כדי להריץ אותו מקומית תצטרכו לפחות 16 גיגה־בייט של זיכרון עבודה במחשב ועוד 16 גיגה־בייט בזיכרון של כרטיס המסך. הרצה על המעבד בלבד אינה נתמכת כלל, כך שחובה להחזיק כרטיס מסך מתאים.

סביבת העבודה דורשת התקנה של חבילות פייתון מסוימות, בהן ספריית modelscope בגרסה 1.4.2, יחד עם open_clip_torch ו־pytorch-lightning. מורידים את המשקלים מראש, טוענים אותם באמצעות הצינור המובנה ומעבירים מילון עם מפתח יחיד של טקסט קצר. אם אין לכם חומרה כזו, המפתחים מספקים סביבות הדגמה מוכנות ב־Colab, ב־ModelScope Studio וב־Hugging Face Spaces.

pip install -U huggingface_hub
hf download ali-vilab/modelscope-damo-text-to-video-synthesis

הקבצים

6 קבצים במאגר, 13.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר ברישיון cc-by-nc-4.0. המשמעות פשוטה, אסור לעשות בו שום שימוש מסחרי, יש לתת קרדיט למחברים המקוריים, והוא מיועד לצורכי מחקר, ניסויים ולמידה אישית בלבד. אי אפשר לשלב אותו במוצר שמייצר הכנסה או לגבות כסף על תוצרים שמבוססים עליו.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗