GPT
G

GroundingME

קוד פתוח

lirang04other2025-12-21

  • multimodal
  • visual-grounding
  • mllm

מבחן ביצועים שמאתגר מודלי ראייה שפה בזיהוי אובייקטים לפי טקסט. הוא נבנה כדי לבדוק מקרים קשים במיוחד כמו הסתרות, יחסים מרחביים מורכבים ושאילתות שאין להן מענה בתמונה.

  • 654הורדות בחודש
  • 76לייקים

מה זה

המאגר מיועד לבדיקת יכולות visual grounding ומכיל נתוני מבחן המחולקים לארבעה ממדים עיקריים. הממד הראשון בודק הבחנה בין אובייקטים דומים מאוד. הממד השני מתמקד ביחסים מרחביים מורכבים בין פריטים. הממד השלישי בוחן זיהוי של אובייקטים זעירים או מוסתרים בחלקם, והממד הרביעי מציג שאילתות שאינן ניתנות למיקום בתמונה ומחייב את המודל לדחות אותן.

הנתונים מבוססים על מקורות קודמים, כולל שימוש בתנאי הרישוי של SA-1B ושל HR-Bench. כל רשומה כוללת תמונה, תיאור טקסטואלי, תיחום גיאומטרי של האובייקט וסיווג לקטגוריית הבדיקה המתאימה. המבנה ממוקד כולו בהערכת ביצועים ולא באימון בסיסי.

מתאים ל

  • בדיקת עמידות מודלי ראייה

    הרצת סקריפטים כדי למדוד דיוק של מודלי שפה רב-מודאליים במצבי קיצון של הסתרה.

  • הערכת זיהוי יחסים מרחביים

    מדידת היכולת של מודל להבין פקודות שמגדירות מיקום יחסי מורכב בתוך פריים עמוס.

  • בחינת מנגנוני דחיית שאלות

    בדיקה אם המערכת יודעת לסרב כשמבקשים ממנה לאתר עצם שלא מופיע בפועל בתמונה.

איפה זה נופל

המאגר מכיל פיצול מבחן בלבד ולכן אינו מתאים לאימון ישיר של מודלים. התיאורים כתובים באנגלית בלבד, כך שאין כאן בדיקה של הבנה בעברית או בשפות אחרות. מעבר לכך, המבחן נשען על תמונות ממקורות קיימים ויורש את ההטיות הוויזואליות שלהם, בלי לספק מענה למשימות שאינן איתור מלבני של עצמים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הנתונים מיועדים למחקר בלבד. הרישיון כפוף למגבלות של SA-1B ו־HR-Bench, שאוסרות שימוש מסחרי ישיר. אם אתם בונים כלי למכירה, תצטרכו להשתמש במאגרי הערכה אחרים.

האם המאגר כולל תמיכה בעברית?

התיאורים הטקסטואליים בדאטהסט מופיעים באנגלית בלבד. הכרטיס לא מציין שום תרגום או תמיכה בשפות אחרות. כדי לבדוק מודלים בעברית, תידרשו לתרגם את השאילתות באופן עצמאי.

איך הנתונים מאורגנים להורדה?

המידע מחולק לארבעה קבצי parquet המכילים את נתוני המבחן, לצד קובץ tsv בודד. הקבצים זמינים להורדה פתוחה מיידית ללא צורך בהרשמה מיוחדת או אישור ידני מהיוצרים.

במה המאגר הזה שונה מ־RefCOCOg הרגיל?

בניגוד למאגרים ישנים שבודקים בעיקר התאמות פשוטות, כאן הוכנסו אתגרים ממוקדים כמו עצמים זעירים ומקרי דחייה. החוקרים אף פרסמו בנפרד גרסה ייעודית של RefCOCOg הכוללת דחיות כדי לחשוף שגיאות של מודלים מודרניים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות פקודת load_dataset עבור הפיצול test. המאגר מאוחסן בארבעה קבצי parquet לצד קובץ tsv, ללא צורך בבקשת אישור גישה מוקדמת. כל רשומה מחזירה את התמונה, שדה description, תיחום מסוג bbox במבנה של ארבע קואורדינטות, ושדה subtask_l1 שמגדיר את סוג האתגר.

from datasets import load_dataset

ds = load_dataset("lirang04/GroundingME")

הרישיון

הרישיון מוגדר כ־other ומבוסס על תנאי השימוש של SA-1B ו־HR-Bench. החוקרים מציינים במפורש שהשימוש מותר למחקר בלבד. המשמעות היא שאסור לשלב את הנתונים במוצר מסחרי, ואין להשתמש בהם כדי להעריך או לפתח מערכות שמיועדות למכירה או לרווח.

הרישיון המלא ב־Hugging Face ↗