GPT
C

CV-Bench

קוד פתוח

nyu-visionxapache-2.02024-06-17

מבחן ביצועים ממוקד ראייה שבודק מודלים רב-מודליים על הבנה מרחבית דו-ממדית ותלת-ממדית. הוא מתאים למי שרוצה למדוד ספירת עצמים, יחסי מיקום, עומק ומרחקים בלי להסתמך על ידע כללי בלבד.

  • 7,772הורדות בחודש
  • 48לייקים

מה זה

המאגר כולל 2,638 דוגמאות שעברו בדיקה ידנית, ונבנו על בסיס נתונים קיימים מעולמות הראייה הממוחשבת: ADE20k, COCO ו־Omni3D. החוקרים לקחו את התיוגים המקוריים של מאגרים אלה ויצרו מהם שאלות רב-ברירה באנגלית, במטרה לבחון יכולות ראייה טהורות של מודלי שפה רב-מודליים.

הנתונים מחולקים לשני סוגי משימות עיקריים. החלק הדו-ממדי מתמקד בספירת עצמים וביחסים מרחביים בתוך הפריים, בעוד החלק התלת-ממדי בוחן הבנה גאומטרית עמוקה יותר כמו סדר עומק ומרחקים יחסיים בין אובייקטים. כל רשומה כוללת את התמונה עצמה, שאלה מנוסחת, אפשרויות בחירה, התשובה הנכונה ופרומפט מובנה, לצד מטא-דאטה מהמקור כמו תיחום מרחבי או סיווג מטרה.

מתאים ל

  • מבחן ביצועים להבנה מרחבית

    בדיקת הדיוק של מודלים רב-מודליים בזיהוי עומק, מרחקים יחסיים ויחסי מיקום בין אובייקטים בתוך תמונה.

  • בדיקת יכולות ספירה

    הערכת היכולת של מודל ראייה לספור במדויק עצמים מקטגוריות שונות המופיעים בסצנה.

  • השוואת ארכיטקטורות ראייה

    חישוב ציון משוקלל דו-ממדי ותלת-ממדי להשוואה ישירה בין מקודדי תמונה ומודלי בסיס שונים.

איפה זה נופל

המאגר כולו באנגלית ומתאים להערכה בלבד, שכן 2,638 דוגמאות אינן מספיקות לאימון מודלים. המקורות שלו נשענים לחלוטין על סטים קלאסיים כמו COCO ו־ADE20k, כך שאם המודל שלכם נחשף אליהם מראש במהלך האימון, התוצאות עלולות להיות מוטות עקב דליפת מידע. בנוסף, המשימות מוגבלות לשאלות רב-ברירה סגורות, ולכן הן לא בודקות יכולת ניסוח חופשית או יצירת תיאורים מורכבים.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

כן, הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי חופשי לצד עמידה בתנאי הרישיון כמו מתן קרדיט. עם זאת, התמונות נאספו ממאגרים חיצוניים כמו COCO, ADE20k ו־Omni3D, ומומלץ לוודא שהשימוש שלכם תואם גם לתנאי המקור שלהם.

האם יש במאגר תמיכה בעברית?

לא, כל השאלות, אפשרויות הבחירה והפרומפטים מנוסחים באנגלית בלבד. אם רוצים לבחון יכולות בעברית, תצטרכו לתרגם את השדות בעצמכם.

איך נאספו הנתונים במאגר?

היוצרים לקחו תמונות ותיוגים קיימים מתוך COCO, ADE20k ו־Omni3D ותרגמו אותם לשאלות רב-ברירה. כל 2,638 הדוגמאות עברו בדיקה ידנית כדי לוודא את נכונות השאלות והתשובות.

האם המאגר מיועד לאימון מודלים?

לא, המאגר קטן מדי וכולל רק כמה אלפי דוגמאות בדיקה. הוא נבנה ככלי מדידה והערכה בלבד לבחינת היכולות המרחביות של מודלים קיימים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בלי צורך באישור גישה או הרשמה מיוחדת. אפשר להוריד את המאגר המלא בקריאה פשוטה ל־nyu-visionx/CV-Bench, או לטעון רק את התצורות הנפרדות של 2D או 3D. הנתונים מגיעים בקובצי parquet הכוללים את התמונות והתיוגים יחד, ויש גם קובצי jsonl עם תיקיית תמונות נפרדת. השדות המרכזיים לעבודה עם מודלים הם image, prompt ו־answer.

from datasets import load_dataset

ds = load_dataset("nyu-visionx/CV-Bench")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מאפשר שימוש חופשי, כולל שימוש מסחרי, שינוי והפצה של הנתונים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. השימוש בו להערכת מודלים מסחריים מותר, ואין דרישה לשתף את השינויים תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗