GPT
P

PE-Video

קוד פתוח

facebookcc-by-nc-4.02025-03-28

מאגר וידאו ממוקד תנועה עם כמעט מיליון סרטונים ותיאורי טקסט מפורטים. הוא נועד למי שמאמן מודלים להבנת וידאו, אחזור או יצירת כתוביות וזקוק לשילוב של צילומי גוף ראשון ושלישי.

  • 8,086הורדות בחודש
  • 51לייקים

מה זה

המאגר כולל 998,862 סרטונים באורך ממוצע של 16.7 שניות ובקצב של כמעט 30 פריימים לשנייה. התוכן מתמקד בתנועה ומחולק לעשר קטגוריות שונות, ביניהן פעולות ידיים, אינטראקציה עם חפצים, הכנת אוכל, פעילויות עבודה, חיות וטבע. הסרטונים מציגים גם נקודת מבט של גוף ראשון וגם נקודת מבט של גוף שלישי.

לכל הסרטונים יש תיאורי טקסט ומילות מפתח שמסכמים את הפעולות, האירועים והעצמים שמופיעים בהם. מתוך כלל המאגר, 118,862 סרטונים כוללים כתוביות שעברו בדיקה ותיקון ידניים של בודקים אנושיים, שתפקידם היה לנקות הזיות של מודלים, להסיר כפילויות ולהוסיף פעולות מרכזיות שנשמטו מהתיאור האוטומטי.

מתאים ל

  • אימון מודלים לאחזור וידאו

    התאמה בין שאילתות טקסט לקטעי וידאו ממוקדי פעולה לפי מילות המפתח והתיאורים.

  • מחוללי כתוביות לווידאו

    אימון מערכות ליצירת תיאורי טקסט אוטומטיים מתוך תנועות ופעולות בסרטונים.

  • הערכת מודלים רב-מודאליים

    בדיקת ביצועים על בסיס 118,862 הסרטונים שכוללים תיאורים מאומתים בידי אדם.

איפה זה נופל

הרזולוציה הממוצעת נמוכה למדי ולא תתאים למי שמחפש וידאו באיכות גבוהה לפרטים עדינים. כרטיס המאגר לא מפרט את מקור הסרטונים המקורי או את שפת התיאורים, שככל הנראה נכתבו באנגלית בלבד. בנוסף, רוב המאגר מבוסס על תיאורים אוטומטיים שלא נבדקו בידי אדם, כך שרק חלק קטן מהתוכן עבר בקרת איכות קפדנית, ואין בו שום התייחסות לטקסט בעברית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-4.0, המגביל את השימוש למטרות שאינן מסחריות בלבד. אם המטרה היא לאמן מודל למוצר מסחרי, לא תוכלו להשתמש בו.

האם יש במאגר סרטונים או תיאורים בעברית?

לא ידוע על תוכן בעברית. כרטיס המאגר באנגלית ואינו מציין תמיכה בריבוי שפות, כך שכל הטקסטים והתיאורים מופיעים באנגלית בלבד.

איך נאספו ונוצרו תיאורי הסרטונים?

התיאורים הראשוניים הופקו באופן ממוחשב. לאחר מכן, בודקים אנושיים עברו על 118,862 קטעים, תיקנו טעויות והזיות של המודל, מחקו מלל מיותר והוסיפו פעולות חסרות.

באיזה מבנה הקבצים מגיעים?

הנתונים מחולקים ל־2,000 קובצי tar שונים בתיקייה בשם extended. תצטרכו להוריד ולפתוח את הארכיונים באופן יזום כדי לגשת לקובצי הווידאו והטקסט.

איך טוענים

הנתונים מפוצלים ל־2,000 קובצי ארכיון בפורמט tar תחת תיקיית extended, מה שדורש פריקה מסודרת ותשתיות אחסון משמעותיות לפני שמתחילים לעבוד. הרזולוציה הממוצעת של הקליפים עומדת על 604 על 346 פיקסלים. הגישה למאגר פתוחה לחלוטין ואין צורך באישור מיוחד, אך כדאי לשים לב להבדל בין התוויות שנוצרו אוטומטית לבין אלו שעברו אימות אנושי בעת טעינת הנתונים לאימון.

from datasets import load_dataset

ds = load_dataset("facebook/PE-Video")

הרישיון

המאגר שוחרר ברישיון cc-by-nc-4.0, מה שאומר שהוא מיועד למחקר ולשימוש אישי בלבד. שימוש מסחרי מכל סוג אסור בהחלט, כולל שילוב הנתונים במוצרים עסקיים או אימון מודלים שמשרתים שירות בתשלום. בנוסף, חובה לתת ייחוס מתאים לפייסבוק בעת שימוש בנתונים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗