GPT
M

MVBench

קוד פתוח

OpenGVLabmit2023-11-28

מאגר לבדיקת יכולות הבנה וניתוח של רצף זמני בווידאו באמצעות שאלות אמריקאיות. הוא מיועד למי שרוצה להעריך מודלי וידאו רב-מודאליים על בסיס תשובות מוגדרות מראש וללא ניקוד מוטה.

  • 19,397הורדות בחודש
  • 47לייקים

מה זה

המאגר מכיל בין אלף לעשרת אלפים דוגמאות של שאלות רב-ברירה שנבנו מתוך סרטוני וידאו ציבוריים. הרעיון המרכזי כאן הוא בדיקת יכולות דינמיות לאורך ציר הזמן, מתפיסה בסיסית ועד הסקת מסקנות קוגניטיבית. במקום לתת למודל שפה גדול לנחש או להעריך תשובות פתוחות, המפתחים המירו תיוגים קיימים לשאלות אמריקאיות עם תשובה נכונה אחת ברורה.

התוכן מחולק לעשרים משימות זמניות שונות, כולל זיהוי פעולות הפוכות שמופיעות בקבצי הנתונים, כמו action antonym. הסרטונים עצמם נשמרו בפורמט הגולמי שלהם, ברזולוציה מקורית ובאורך מלא, לצד נקודות זמן של התחלה וסיום וכתוביות מקוריות, כדי לאפשר גמישות מרבית במחקר ובבדיקות.

מתאים ל

  • הערכת מודלי וידאו גדולים

    בדיקת יכולות הסקת מסקנות ורצף זמני במודלים רב-מודאליים על גבי עשרים משימות מוגדרות.

  • סיווג פעולות בווידאו

    מדידת ביצועים בזיהוי פעולות מורכבות והבנת סדר כרונולוגי של אירועים מתוך קטעי תנועה.

  • בדיקת פרומפטים להסקה

    בחינת ניסוחים והנחיות מערכת שמטרתן לחלץ תשובות מדויקות במבחנים אמריקאיים מבוססי וידאו.

איפה זה נופל

הטקסט כולו בנוי באנגלית בלבד, כך שאין כאן שום תמיכה או בדיקה של הבנת עברית. חסרון בולט נוסף הוא התלות בחומרים חיצוניים שדורשים הורדה ידנית נפרדת ולא מאפשרים ריצה אוטומטית מלאה מהקופסה. בנוסף, מאחר שחלק מהסרטונים נשמרו באורכים מלאים וברזולוציות גבוהות, תהליך פענוח הווידאו עשוי להיות אטי במיוחד ולעכב מערכי בדיקה שדורשים זמני ריצה מהירים.

שאלות
נפוצות

האם המאגר כולל את כל הסרטונים להורדה ישירה?

לא. רוב החומר נמצא במאגר, אך עקב מגבלות רישוי יש להוריד ידנית 320 סרטונים ששייכים ל־NTU RGB+D ישירות מאתר החיצוני של המעבדה. המאגר כולל רשימת שמות מדויקת כדי שתוכלו לאתר את הקבצים החסרים.

האם יש במאגר שאלות או כתוביות בעברית?

לא, הנתונים מתועדים באנגלית בלבד. כל השאלות, האפשרויות והתיוגים המקוריים נכתבו באנגלית. אם המטרה שלכם היא להעריך מודלים בשפה העברית, תצטרכו לתרגם את השאלות והתשובות באופן עצמאי.

איך המאגר מונע הטיות של מודלי שפה בבדיקה?

במקום להסתמך על מודל שפה גדול שישפוט תשובות פתוחות, המפתחים יצרו שאלות אמריקאיות ישירות מתיוגים אנושיים קיימים. התשובה הנכונה נקבעת מראש מתוך נתוני האמת של הסרטון. המבנה הזה מאפשר מדידה מדויקת וניטרלית של שיעור הדיוק.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר עצמו מוגדר תחת רישיון MIT שמאפשר שימוש מסחרי, אך יש לוודא את תנאי השימוש של סרטוני המקור. 320 הסרטונים מתוך NTU כפופים לרישוי נפרד של המוסד שפרסם אותם. מומלץ לקרוא את תנאי המקורות הללו לפני שילוב הנתונים במוצר.

איך טוענים

הנתונים מחולקים לקובצי JSON שמכילים את השאלות, האפשרויות והתשובות, לצד קובצי הווידאו עצמם שנמצאים במאגר. שימו לב שבגלל רישוי של מאגר חיצוני, 320 סרטונים שמקורם בפרויקט NTU RGB+D אינם כלולים בהורדה הישירה מהאגינג פייס. תצטרכו להוריד אותם ידנית מאתר ROSE Lab לפי רשימת שמות הקבצים שמצורפת במאגר. פריקת הסרטונים הגולמיים יכולה לקחת זמן ומאמץ חישובי, בייחוד קטעים כבדים שמקורם במבחני תפיסה.

from datasets import load_dataset

ds = load_dataset("OpenGVLab/MVBench")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש חופשי למטרות מחקר ומסחר, כולל שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים המקורית. עם זאת, יש לשים לב שחלק מהסרטונים שמקורם במאגרי צד שלישי, כמו המקטעים מתוך NTU RGB+D, כפופים לרישיונות נפרדים שמגבילים את הגישה הישירה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗