GPT
M

MMStar

קוד פתוח

Lin-Chenרישיון לא דווח2024-04-02

1,500 שאלות רב-ברירה מבוססות תמונה שאי אפשר לנחש בלי להסתכל על הקובץ הוויזואלי. אספו אותן כדי לבדוק מודלי ראייה-שפה על יכולות אמיתיות בלי זליגת מידע מטקסט בלבד.

  • 16,213הורדות בחודש
  • 53לייקים

מה זה

המאגר מציע 1,500 דוגמאות הערכה שנבחרו בקפידה מתוך מאגר ראשוני של 22,401 רשומות. תהליך הסינון כלל שלב גס שצמצם את הכמות ל־11,607 מועמדים, ולאחריו בדיקה ידנית שנועדה להבטיח שכל שאלה מחייבת התבוננות מעמיקה בתמונה ולא מאפשרת ניחוש על בסיס הידע הטקסטואלי של מודל השפה לבדו.

המבנה הפנימי מאוזן ומחולק לשישה תחומי יכולת מרכזיים, כאשר כל תחום כולל בדיוק 250 שאלות. התחומים האלה מתפצלים ל־18 צירים מפורטים יותר עם חלוקה שווה ביניהם. הפורמט מתבסס על שאלות רב-ברירה ומענה לשאלות סביב תמונה, והוא מיועד להרצה לא מקוונת כדי לבדוק את הביצועים המדויקים של המודל שלכם מול מדדים נקיים מזליגות מידע.

מתאים ל

  • הערכת מודלי ראייה-שפה

    בדיקת יכולות המודל מול 1,500 שאלות שדורשות הבנה ויזואלית אמיתית.

  • בדיקת זליגת מידע

    הרצת המבחן ללא התמונה כדי לאתר מקרים שבהם המודל מסתמך על ידע טקסטואלי בלבד.

  • השוואה למובילי התחום

    מדידת הדיוק מול תוצאות מפורסמות של מודלים כמו GPT-4V ו־Gemini.

איפה זה נופל

הנתונים כולם באנגלית בלבד ואין כאן אף מילה בעברית. המאגר מיועד אך ורק להערכה ולא יספיק לאימון או לכוונון עדין בגלל גודלו המזערי של 1,500 דוגמאות. מעבר לזה, המשימות מוגבלות לשאלות רב-ברירה מוגדרות מראש, כך שזה לא משקף יכולות שיחה חופשית או יצירת טקסט ארוך. צריך לקחת בחשבון שאין פירוט על המקורות המדויקים של התמונות עצמן, וסביר להניח שהן נאספו מהרשת בלי בדיקת זכויות יוצרים מסחריות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא כדאי. המאגר פורסם ללא רישיון מוגדר, מה שאומר שאין לכם היתר שימוש מסחרי מפורש. הוא מתאים להערכה ומחקר פנימי בלבד.

כמה המאגר שוקל והאם הוא כבד להורדה?

המאגר כולל בסך הכל 1,500 רשומות ומגיע בקובצי TSV ו־Parquet. מדובר בנפח קטן מאוד שיורד תוך שניות בודדות בכל חיבור אינטרנט.

האם יש במאגר שאלות בעברית?

לא. כל השאלות והתשובות מנוסחות באנגלית בלבד. אם המודל שלכם מיועד לעברית, תצטרכו לתרגם את השאלות בעצמכם או לבחון אותו באנגלית.

מה מבדיל את המאגר הזה מדאטהסטים אחרים של שאלות ותשובות לתמונה?

היוצרים סיננו אלפי דוגמאות באופן ידני כדי למנוע מצב שמודל שפה חכם יכול לנחש את התשובה בלי להביט בתמונה. כאן חובה להשתמש בעיבוד תמונה כדי לפתור את השאלה.

איך טוענים

טוענים את הקבצים ישירות מהמאגר ללא צורך בהרשאה מוקדמת או אישור גישה. הנתונים מגיעים בקובץ Parquet לצד עותק בפורמט TSV, כך שאפשר לעבוד איתם בכל סביבת פייתון סטנדרטית עם ספריית פנדס או דרך Hugging Face. מדובר בסט נתונים קומפקטי של 1,500 שורות בלבד, ולכן זמן הטעינה ומשאבי הזיכרון אפסיים. השדות החשובים כוללים את התמונה המצורפת, השאלה, האפשרויות והתשובה הנכונה, ומומלץ להריץ מולם מבחן ללא תמונה כדי לוודא שהמודל שלכם אכן מתבסס על הקלט הוויזואלי.

from datasets import load_dataset

ds = load_dataset("Lin-Chen/MMStar")

הרישיון

היוצרים לא ציינו רישיון כלל בכרטיס המאגר. מבחינה משפטית, היעדר רישיון פירושו כל הזכויות שמורות ולא מומלץ להשתמש בנתונים האלה לצרכים מסחריים או להטמיע אותם בתוך מוצר פעיל. אפשר להשתמש בהם למחקר פנימי ולהשוואת ביצועים על בנצ'מרק, אבל מודל שמאומן עליהם ישירות עלול להיתקל בבעיה חוקית בהפצה.

הרישיון המלא ב־Hugging Face ↗