GPT
V

VideoUFO

קוד פתוח

WenhaoWangcc-by-4.02025-02-18

  • video-generation
  • text-to-video-dataset

מעל מיליון קטעי וידאו שממוקדים בנושאים פופולריים של משתמשים אמיתיים. החבילה מציעה תיאורים קצרים ומפורטים לצד ציוני איכות מוכנים מראש לצורכי יצירת וידאו מטקסט.

  • 5,145הורדות בחודש
  • 27לייקים

מה זה

המאגר מכיל מעל 1.09 מיליון קטעי וידאו שחולקו בין 1,291 נושאים שונים. הרעיון המרכזי מאחורי האוסף הוא התמקדות במה שאנשים באמת מבקשים לייצר בעולם האמיתי, במקום להסתמך על תכנים כלליים או אקראיים מהרשת. כל רשומה כוללת מזהה ייחודי, הגדרת נושא, זמני התחלה וסיום מדויקים של הקטע, תיאור טקסטואלי קצר ותיאור מפורט ועשיר.

בנוסף לתיאורים הטקסטואליים, החוקרים הוסיפו לכל סרטון שישה ציוני איכות נפרדים שמבוססים על מדד VBench. החלוקה הפיזית במאגר נעשית באמצעות קובץ מטא-דאטה מרכזי וסדרה של 200 קובצי ארכיון דחוסים שמכילים את הווידאו עצמו. המבנה הזה נועד לאפשר אימון ישיר של מודלים גנרטיביים מבוססי טקסט או תמונה, תוך יכולת לסנן תכנים מראש לפי רמות איכות ונושאים מוגדרים.

מתאים ל

  • אימון מודלי text-to-video

    התאמת משקולות של מודלי וידאו לנושאים פופולריים בעזרת 1.09 מיליון קטעים ותיאורים כפולים.

  • יצירת וידאו מתמונה

    שימוש בפריימים ראשונים ובקטעי הווידאו כדי ללמד מודלים לייצר המשכיות תנועה מתמונת מקור.

  • סינון לפי ציוני איכות

    בניית תת-קבוצות נתונים לאימון מודלים חזקים על בסיס ששת ציוני VBench שמצורפים לכל סרטון.

איפה זה נופל

כל הטקסטים והתיאורים במאגר כתובים באנגלית בלבד, כך שאין כאן תמיכה בעברית או בהקשרים תרבותיים מקומיים. המפתחים לא מפרטים בכרטיס מהיכן בדיוק נדגמו הסרטונים המקוריים או איך בוצע ניקוי זכויות היוצרים של חומרי המקור. לפני שילוב באימון מסחרי, חובה לבדוק ידנית את תוכן הווידאו ולוודא שרמת הדחיסה שלו אינה פוגעת בפרטים הוויזואליים הנדרשים לכם.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

הרישיון המוגדר הוא CC BY 4.0, שמתיר עקרונית שימוש מסחרי בכפוף למתן קרדיט. עם זאת, היוצרים לא מפרטים מה מקור הווידאו ומי מחזיק בזכויות המקוריות של הצילומים, ולכן מומלץ לבצע בדיקה משפטית לפני שימוש במוצר.

כמה נפח אחסון נדרש להורדת הווידאו?

הווידאו הדחוס שוקל כ־800 גיגה-בייט ומחולק ל־200 קובצי tar. כדי לפרוס את החומרים ולעבוד איתם בנוחות תצטרכו נפח דיסק פנוי משמעותי של לפחות טרה-בייט וחצי.

האם יש במאגר נתונים בעברית?

לא, המאגר כולל תיאורים באנגלית בלבד. אם המטרה היא אימון מודל שמגיב להנחיות בעברית, תצטרכו לתרגם את התיאורים הקצרים והמפורטים בעצמכם.

מה מייחד אותו ממאגרי וידאו אחרים?

המאגר ממוקד ב־1,291 נושאים שנבחרו סביב תחומי עניין של משתמשי קצה בעולם האמיתי. בנוסף, כל קטע כולל שני תיאורים ברמות פירוט שונות ושישה ציוני איכות מוכנים מראש מתוך VBench.

איך טוענים

טעינת המטא-דאטה נעשית ישירות דרך ספריית datasets באמצעות פיצול Full, או בהורדה ישירה של קובץ ה־CSV. הווידאו עצמו כבד מאוד ומגיע לכ־800 גיגה-בייט למרות דחיסה. הקבצים מפוזרים על פני 200 ארכיוני tar, כך שתצטרכו לולאת הורדה ייעודית, חיבור רשת מהיר והרבה מקום פנוי בדיסק כדי לפתוח אותם.

from datasets import load_dataset

ds = load_dataset("WenhaoWang/VideoUFO")

הרישיון

הרישיון המדווח הוא CC BY 4.0, שמאפשר שימוש מסחרי, שינוי והפצה, בתנאי שנותנים קרדיט מתאים ליוצרים ומציינים שינויים שנעשו. המודלים שמאומנים על הדאטהסט אינם כפופים לחובת שיתוף זהה, אך חשוב לזכור שהרישיון מכסה את ההפצה הנוכחית ולא פוטר מבדיקת חומרי הגלם המקוריים של הווידאו.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗