GPT
V

VSI-Bench

קוד פתוח

nyu-visionxapache-2.02024-12-17

  • Video
  • Text

מעל 5,000 שאלות ותשובות מבוססות וידאו של חללים פנימיים מגוף ראשון, לבדיקת תפיסה מרחבית במודלים מולטימודליים. שווה לבדוק אותו כי הוא חושף קיצורי דרך טקסטואליים שהמודל מנצל במקום ממש להבין את הווידאו.

  • 7,958הורדות בחודש
  • 69לייקים

מה זה

המאגר כולל 5,130 צמדי שאלות ותשובות שנבנו מתוך 288 סרטוני וידאו של חללי פנים אמיתיים. הסרטונים נלקחו מסט הוולידציה של מאגרי סריקות תלת-ממדיות ציבוריים, בהם ScanNet, ScanNet++ ו־ARKitScenes. המקורות האלה כוללים סביבות מגורים, מעבדות, משרדים וחללי תעשייה באזורים גאוגרפיים שונים, עם תיוגים ברמת האובייקט ששימשו ליצירת השאלות.

השאלות נחלקות לשאלות אמריקאיות ולשאלות בעלות מענה מספרי, הפרוסות על פני עשרה סוגי משימות. מעבר לסט המלא, החוקרים יצרו תת-קבוצה ידנית בשם debiased v1. מתוך הסט המקורי הוסרו 2,768 דוגמאות שניתן היה לפתור על בסיס סטטיסטיקה או ידע כללי בלי לצפות בווידאו, ונשארו 2,362 שאלות שמבודדות טוב יותר חשיבה ויזואלית טהורה.

מתאים ל

  • הערכת תפיסה מרחבית בווידאו

    בדיקת יכולת המודל לחלץ מרחקים ומיקומים של אובייקטים מתוך סרטוני הליכה בחללים סגורים.

  • זיהוי קיצורי דרך בראייה

    השוואת ביצועי מודל שרואה וידאו מול מודל מבוסס טקסט בלבד כדי לבדוק הסתמכות על הטיות.

  • ולידציה למערכות ניווט

    מבחן ביצועים לשאלות כמותיות ואמריקאיות על תלת-ממד בסביבות פנים כמו מעבדות ובתים.

איפה זה נופל

כל הטקסט במאגר מנוסח באנגלית בלבד. הבעיה העיקרית במאגר המקורי היא שמודלים עיוורים, ללא גישה לתמונה, מצליחים לענות על חלק לא מבוטל מהשאלות בעזרת ידע כללי והטיות סטטיסטיות. סינון ה־debiased v1 מתקן את זה חלקית, אך הוא נעשה בצורה ידנית ולא אלגוריתמית, מה ששינה מהותית את התפלגות סוגי השאלות. בנוסף, מדובר במאגר הערכה ולא בסט אימון, והוא מוגבל לסביבות פנים בלבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא apache-2.0 ומאפשר שימוש מסחרי חופשי. עליכם לכלול קרדיט ועותק של הרישיון בתוכנה או בהפצה. שימו לב שהסרטונים מגיעים במקור מסריקות כמו ScanNet, ולכן כדאי לוודא שאין תנאים סותרים מול המאגרים המקוריים.

האם יש במאגר נתונים בעברית?

לא. כל 5,130 השאלות, האפשרויות והתשובות כתובות באנגלית בלבד. אם המוצר שלכם פועל בעברית, תצטרכו לתרגם את השאלות בעצמכם כדי לבצע הערכה בשפה המקומית.

מה ההבדל בין הגרסה המלאה לגרסת debiased?

הגרסה המלאה מכילה 5,130 שאלות, אך רבות מהן נפתרות על ידי מודלים גם בלי לראות את הווידאו. גרסת debiased v1 כוללת 2,362 שאלות שנבחרו ידנית כדי להוציא שאלות עם קיצורי דרך טקסטואליים, ומודדת יכולת מרחבית אמיתית בצורה מחמירה יותר.

מאיפה הגיעו הנתונים ואיך נאספו?

השאלות נבנו על בסיס 288 סרטונים מתוך סטי הוולידציה של ScanNet, ScanNet++ ו־ARKitScenes. החוקרים ניצלו את נתוני התלת-ממד והאובייקטים שכבר תויגו בסריקות האלה כדי לנסח שאלות מדויקות על החלל והיחסים בין החפצים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets עם השם nyu-visionx/VSI-Bench. אפשר לטעון את כל הסט בתצורת full, או לבחור בקונפיגורציות debiased ו־pruned. אין צורך בבקשת גישה מיוחדת, והתיוגים מגיעים בקובצי Parquet ו־JSONL. הסרטונים עצמם מאוחסנים בארכיבי zip נפרדים לפי מקור הסריקה. השדות החשובים לניתוח הם id, question, ground_truth, options, question_type, והדגל הבוליאני pruned שמסמן אילו דוגמאות סוננו בגרסת הניקוי.

from datasets import load_dataset

ds = load_dataset("nyu-visionx/VSI-Bench")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש חופשי כולל שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובת שיתוף תחת אותו רישיון, ומודלים שתאמנו או תוקפו על הנתונים אינם מחויבים להיפתח בקוד פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗