GPT
V

Vera-Layered-Video-Dataset

קוד פתוח

netflixapache-2.02026-04-04

  • diffusion
  • layered-diffusion
  • video
  • layered-video-dataset
  • video-editing

מאגר וידאו מבוסס שכבות לעריכת תוכן שמשלב סרטונים מקוריים, מסכות אלפא ושכבות עריכה. הוא מיועד למי שמפתח מודלי דיפוזיה לעריכת וידאו תוך שמירה מדויקת על האובייקטים המקוריים.

  • 2,818הורדות בחודש
  • 60לייקים

מה זה

המאגר מכיל מעל תשעים אלף קבצים שמחולקים לקטעי וידאו קצרים בשני אורכים: 49 פריימים שנמשכים כשלוש שניות, ו־81 פריימים שנמשכים כחמש שניות. הדוגמאות מתמקדות בשני סוגי עריכה מוגדרים: החלפת רקע והוספת אובייקט לסצנה. בכל מקרה הנתונים בנויים כך שהם מפרידים בין מה שצריך לייצר לבין מה שצריך לשמר, באמצעות שכבת עריכה ייעודית ומסכת שקיפות.

חומרי האימון נאספו משילוב של מקורות וידאו חינמיים כמו Pexels ו־Mixkit לצד מאגר הווידאו והמסיכות VideoMatte240K. החלוקה הפנימית מפרידה בין סטים ריאליסטיים לסטים סינתטיים. בסט הריאליסטי יש פחות מאלפיים דוגמאות בכל אורך, בעוד החלק הסינתטי מרכיב את רוב הדאטהסט עם כמעט עשרת אלפים דוגמאות בגרסת שלוש השניות וכחמשת אלפים דוגמאות בגרסת חמש השניות.

מתאים ל

  • אימון מודלי דיפוזיה לעריכה

    אימון מודלים שמפרידים שכבות וידאו ומייצרים מסכות שקיפות לצד שכבת עריכה חדשה.

  • החלפת רקע אוטומטית בווידאו

    פיתוח כלים שמחליפים רקע בסרטון קיים תוך שמירה מלאה על תנועת הדמות בחזית.

  • הוספת אובייקטים מונפשים

    שילוב אלמנטים סינתטיים חדשים לתוך סצנה מצולמת ללא פגיעה ביתר הפריימים.

איפה זה נופל

המאגר מוגבל אך ורק לשתי משימות עריכה ספציפיות: החלפת רקע והוספת אובייקט. אם אתם מחפשים שינויי סגנון כלליים, תנועות מצלמה מורכבות או עריכות מבוססות טקסט ארוך, זה לא נמצא כאן. בנוסף, הסרטונים קצרים מאוד, שלוש עד חמש שניות בלבד, כך שאין כאן מידע על עקביות לאורך סצנות ארוכות. סט הבדיקה עצמו זעיר וכולל 141 דוגמאות בלבד, כך שלא הייתי מסתמך רק עליו לצורך בדיקת ביצועים לפני העלאת מודל לפרודקשן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר הראשי פורסם תחת רישיון Apache 2.0 שמתיר שימוש מסחרי מלא. עם זאת, סט הבדיקה כולל דוגמאות ממאגר DAVIS שמוגבל ברישיון לא מסחרי. מומלץ להשתמש בנתוני האימון לפיתוח מסחרי ולהימנע משימוש בחלקי הבדיקה שכוללים מגבלות רישוי.

האם הדאטהסט כולל טקסט בעברית?

לא. המאגר מתמקד בקובצי וידאו, מסכות ושכבות חזותיות, והקוד או הקבצים הנלווים מנוהלים באנגלית בלבד. אין בו הנחיות טקסטואליות או תיוגים בשפה העברית.

מאיפה הגיעו הסרטונים שמופיעים במאגר?

חומרי האימון נאספו מאתרי הווידאו החופשיים Pexels ו־Mixkit, יחד עם נתונים ממאגר VideoMatte240K שסיפק את מסכות הווידאו. סט הבדיקה כולל גם דגימות מתוך DAVIS ו־VACEBench.

מה מייחד את המאגר הזה בהשוואה למאגרי וידאו רגילים?

במקום לתת רק סרטון שלם, המאגר מציע מבנה שכבות שמפריד בין הווידאו המקורי, שכבת העריכה ומסכת אלפא. המבנה הזה נועד לאמן מודלים לדעת מה לשמר בסצנה ומה לייצר מחדש.

איך טוענים

הנתונים מאורגנים בתיקיות שמכילות קובצי וידאו בפורמט MP4 יחד עם קובצי מטא-דאטה בפורמט JSONL, למשל bg-change.jsonl. אין צורך בבקשת גישה מיוחדת או באישור ידני של נטפליקס כדי להוריד את הקבצים. לפני שרצים למשוך את הכל, קחו בחשבון שמדובר ביותר מתשעים אלף קבצים נפרדים, מה שאומר שהורדה וטעינה ישירות דרך הספרייה הרגילה עשויות לקחת זמן ולדרוש טיפול במקביליות וברוחב פס רציני.

from datasets import load_dataset

ds = load_dataset("netflix/Vera-Layered-Video-Dataset")

הרישיון

המאגר עצמו פורסם תחת רישיון Apache 2.0, שמאפשר שימוש מסחרי, שינוי והפצה כל עוד שומרים על הודעת זכויות היוצרים. יחד עם זאת, חשוב לשים לב שמקורות הנתונים מעורבים: חלק מסט הבדיקה נשען על DAVIS שמופץ ברישיון CC BY-NC 4.0 שאינו מסחרי, ולכן שימוש בסט הבדיקה הספציפי הזה מוגבל למחקר בלבד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗