GPT
P

PerceptionBench

קוד פתוח

moonshotaicc-by-nc-4.02026-07-23

  • multimodal
  • visual-perception
  • mllm
  • benchmark

המאגר בודק איפה מודלים רב-מודליים נכשלים בראייה בסיסית בלבד, בלי לערבב ידע כללי או היגיון מורכב. הוא נועד למי שרוצה לאבחן בעיות תפיסה חזותית נטו במודל שלו.

  • 3,552הורדות בחודש
  • 50לייקים

מה זה

המאגר מכיל 3,000 שאלות מאומתות עם תשובות פתוחות, קצרות וחד-משמעיות, שמיועדות למשימות מענה על שאלות חזותיות. כל שאלה בודקת יכולת תפיסתית אטומית אחת בלבד מתוך עשר קטגוריות מוגדרות: יחסים חזותיים, ספירה, תכונות, עומק ותלת-ממד, מיקום, השוואה, זיהוי ברזולוציה עדינה, שילוב הקשר, זיהוי טקסט והזיות מבוססות ראייה.

הבסיס נבנה מניתוח נקודות כשל מוקדמות של מודלים מובילים ב־42 בנצ'מרקים קיימים. מתוך 3,000 השאלות, 1,800 נגזרו מפירוק שאלות שבהן מודלים נכשלו במאגרים אלה, ו־1,200 שאלות נכתבו מחדש על גבי תמונות משלימות. כל הדוגמאות נדגמו מתוך מאגר פנימי של יותר מ־17,000 דגימות תוך איזון בין היכולות ושכבות הקושי.

מתאים ל

  • הערכת תפיסה חזותית במודלים

    מדידת יכולת הראייה הבסיסית של מודל רב-מודלי ללא תלות ביכולות ההסקה שלו.

  • אבחון הזיות ראייה

    בדיקת הנטייה של המודל להמציא פרטים שלא קיימים בתמונה בקטגוריית ההזיות.

  • ניתוח חולשות ארכיטקטוניות

    מיפוי ביצועים לפי עשר קטגוריות נפרדות כמו עומק, ספירה או מיקום במרחב.

איפה זה נופל

המאגר כולו באנגלית בלבד ואין בו תמיכה בשפות אחרות או בעברית. בנוסף, 3,000 הדגימות נבחרו מתוך כשלים של מודלים חזקים ספציפיים, מה שעלול לייצר הטיה מובנית לכשלים שמאפיינים ארכיטקטורות מסוימות. קטגוריית ההזיות התפיסתיות התגלתה כחלשה ביותר בכל המודלים שנבדקו, עם ביצועים נמוכים במיוחד, כך שהציון עלול להיות קשוח מאוד ולא משקף שימושיות כללית במוצר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-4.0, שמגביל את השימוש למטרות לא-מסחריות בלבד. מותר להשתמש בו למחקר, השוואות פנימיות ופרסומים אקדמיים, אך אסור לאמן עליו מודלים מסחריים.

האם המאגר כולל עברית?

לא, כל השאלות והתשובות מנוסחות באנגלית. אם אתם בודקים מודל בעברית, תצטרכו לתרגם את השאלות או לבחון את רכיב הראייה שלו בלבד דרך פרומפטים באנגלית.

במה הוא שונה מבנצ'מרקים קיימים של תמונה וטקסט?

רוב המאגרים בודקים משימות מורכבות שדורשות ידע כללי והיגיון לצד הראייה, וכך קשה לדעת למה המודל טעה. המאגר הזה מבודד עשר יכולות תפיסה אטומיות ובודק רק אותן בעזרת תשובות קצרות.

איך מחשבים את הציון של המודל בבדיקה הזו?

השאלות הן שאלות פתוחות עם תשובה קצרה ומוגדרת. במחקר המקורי השתמשו במודל שופט בשם GPT-oss-120B שהשווה את תשובת המודל לתשובת הרפרנס, בדיוק שתאם ב־99.7 אחוז בדיקה אנושית.

איך טוענים

הנתונים יושבים בקובץ יחיד בפורמט PerceptionBench.jsonl לצד קובצי תמונות ומסמכים במאגר פתוח ללא צורך באישור גישה. אפשר לטעון את הקובץ ישירות בספריות סטנדרטיות או דרך ממשק datasets של Hugging Face. כל רשומה כוללת את השאלה הפתוחה, התמונה הנבדקת והתשובה המדויקת הקצרה. לצורך הרצת הבדיקה המקורית, החוקרים השתמשו במודל שופט בשם GPT-oss-120B כדי להשוות בין פלט המודל לתשובת הרפרנס.

from datasets import load_dataset

ds = load_dataset("moonshotai/PerceptionBench")

הרישיון

הרישיון הוא cc-by-nc-4.0, מה שאומר שהשימוש מותר למטרות מחקר ולא למטרות מסחריות. אתם מחויבים לתת קרדיט הולם ליוצרים, Moonshot AI, ולציין אם בוצעו שינויים. אי אפשר לשלב את הנתונים באימון מודל שמיועד למכירה או למוצר מסחרי, אלא רק להערכה פנימית ומחקר אקדמי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗