GPT
O

OpenVid-1M

קוד פתוח

nkp37cc-by-4.02024-06-11

  • text-to-video
  • image-to-video
  • Video Generative Model Training
  • Text-to-Video Diffusion Model Training
  • prompts

מאגר וידאו מלווה בתיאורי טקסט באנגלית שמתמקד באיכות תמונה גבוהה ורזולוציה נקייה. הוא נבנה כפתרון לאימון מודלי יצירת וידאו שדורשים רף אסתטי ברור בלי להתפשר על חדות.

  • 63,743הורדות בחודש
  • 281לייקים

מה זה

המאגר כולל מיליון סרטונים שמוצמדים לתיאורי טקסט באנגלית, כאשר כולם נשמרים ברזולוציה של לפחות 512 על 512 פיקסלים. הנתונים לא צולמו במיוחד אלא נאספו מתוך מאגרים קיימים ופומביים כמו פנדה, כרונו מג'יק, אופן סורה פלאן וסלב וי איץ' די, תוך סינון שהתמקד באסתטיקה, חדות ורזולוציה כדי להבטיח איכות ויזואלית גבוהה.

בתוך המאגר הכללי הוגדרה תת קבוצה נפרדת בשם אופן ויד איץ' די, שמרכזת 433 אלף סרטונים ברזולוציית עשרה שמונים פי. החלוקה הזו נועדה למי שרוצה לדלג על עיבוד הקבצים ברזולוציה הנמוכה יותר ולהתמקד ישירות בסרטוני הפרדה גבוהה, שמגיעים עם קובץ מיפוי בפורמט ג'ייסון כדי לדעת איזה סרטון יושב בכל ארכיון דחוס.

מתאים ל

  • אימון טקסט לווידאו

    אימון ישיר של מודלים גנרטיביים מבוססי טקסט לסרטונים ברזולוציה של 512 פיקסלים ומעלה.

  • כוונון איכות למודלים

    שימוש בתת המאגר של 433 אלף סרטוני 1080p כדי לשפר את החדות והאסתטיקה של מודל קיים.

  • יצירת וידאו מתמונה

    פיתוח והערכה של מודלים שמייצרים תנועה ותוכן וידאו מתוך תמונת מקור.

איפה זה נופל

הטקסטים במאגר זמינים באנגלית בלבד ואין בו שום תמיכה בעברית. מאחר שהסרטונים נאספו ממאגרים שונים כמו סלב וי איץ' די שרישיונו המקורי מוגדר כלא ידוע, קיימת בעיה של זכויות יוצרים במקורות הבסיס. המפרסמים מציינים שהמאגר מיועד למחקר ולמטרות שאינן מסחריות בלבד, כך שלא תוכלו לקחת אותו כבסיס למוצר מסחרי מבלי להסתכן בהפרת תנאי המקור של הסרטונים שנדגמו לתוכו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המוצהר הוא סי סי בי וואי 4.0 אך המפרסמים ציינו במפורש שהמאגר מיועד למחקר ולשימוש שאינו מסחרי. בנוסף, הסרטונים נאספו ממאגרים חיצוניים שחלקם בעלי רישיונות מגבילים או לא ידועים, כך שלא בטוח לבנות עליו מוצר.

כמה שטח אחסון צריך בשביל להוריד את המידע?

אם מורידים רק את תת המאגר באיכות גבוהה של 433 אלף סרטונים, צריך בערך ארבעה וחצי טרה בייט. המאגר המלא כולל מיליון סרטונים ותופס נפח גדול בהרבה שמחולק למאות ארכיונים דחוסים.

האם יש במאגר תיאורים בעברית?

לא. כל התיאורים והנתונים מוגדרים באנגלית בלבד. אם המטרה היא יצירת וידאו מטקסט בעברית, תצטרכו לתרגם את קובצי הסי אס וי באופן עצמאי.

מאיפה הגיעו הסרטונים שמקוטלגים במאגר?

הצוות אסף את הסרטונים מתוך מספר מאגרי וידאו ציבוריים קיימים בהם פנדה, כרונו מג'יק, אופן סורה פלאן וסלב וי איץ' די. לאחר מכן הם סיננו החוצה סרטונים באיכות נמוכה כדי להשאיר רק תוכן חד ואסתטי.

איך טוענים

הנתונים מחולקים למאות קובצי זיפ גדולים לצד קובצי סי אס וי שמחזיקים את ההתאמות בין הווידאו לטקסט. הורדה של תת המאגר בחדות גבוהה בלבד דורשת כארבעה וחצי טרה בייט של נפח אחסון, כך שחייבים תשתית מתאימה לפני שמתחילים. חלק מקובצי הזיפ פוצלו לחלקים קטנים מחמישים גיגה בייט ודורשים איחוד ידני לפני החילוץ. אין צורך באישור גישה מיוחד, וקריאת הטקסטים נעשית ישירות דרך פנדס.

from datasets import load_dataset

ds = load_dataset("nkp37/OpenVid-1M")

הרישיון

המאגר מופץ תחת רישיון סי סי בי וואי 4.0 שדורש מתן קרדיט מתאים ליוצרים. עם זאת, היוצרים מדגישים בתיעוד שהשימוש מיועד למטרות מחקר ולא למטרות מסחריות, ומחייבים לעמוד ברישיונות של מאגרי המקור שמהם נלקחו הסרטונים. המשמעות היא שאימון מודל לצורך מוצר מסחרי בעייתי מאוד בגלל מגבלות המקורות.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗