GPT
O

OpenVLMRecords

קוד פתוח

VLMEvalapache-2.02024-07-30

מאגר תוצרי הערכה גולמיים של מודלי ראייה שפה מגוונים מול מבחני ביצועים שונים. הוא חוסך את זמן הריצה והעלויות של הרצת מודלי ענק כדי לבחון תשובות ספציפיות.

  • 5,862הורדות בחודש
  • 15לייקים

מה זה

המאגר מכיל מיליוני רשומות המאורגנות בלמעלה מ־13,000 קבצים, שנוצרו על ידי כלי ההערכה VLMEvalKit ומשמשים את לוח התוצאות של הפרויקט. הנתונים לא כוללים תמונות חדשות לאימון, אלא תיעוד מלא של התשובות והתחזיות הגולמיות שייצרו מודלים שונים עבור מבחני ביצועים מוכרים כמו CCBench, AI2D, BLINK ונוספים.

המבנה הפנימי מסודר לפי תיקיות מודלים תחת ספריית mmeval, כאשר כל קובץ אקסל מרכז את ביצועי המודל מול מבחן ספציפי. הקבצים כוללים את שאלות המבחן ואת הפלט המדויק שייצר המודל. המפרסמים לא מפרטים תהליך סינון ידני של התוכן מעבר לריכוז הפלטים של המערכות שנבדקו, והטקסטים מגיעים בשפות אנגלית וסינית בהתאם למבחנים שנכללו בהרצות.

מתאים ל

  • ניתוח שגיאות של מודלים

    בדיקת כשלים ותשובות שגויות של מודלי ראייה שפה במבחנים קיימים, מבלי לשלם על הרצת המודל מחדש.

  • השוואת ביצועים מיידית

    חישוב מדדים מחדש לפי קריטריונים מותאמים על גבי התשובות הגולמיות שנשמרו בקבצי האקסל.

  • אימון מודלי שיפוט

    שימוש בתשובות המודלים לצורך מחקר על הערכה אוטומטית של משימות ראייה שפה.

איפה זה נופל

המאגר מוגבל אך ורק לאנגלית וסינית, ואין בו שום ייצוג לעברית. הקבצים כוללים תשובות גולמיות בלבד ללא הציונים המחושבים, ובחלק מהמבחנים נדרשת קריאה ל־API של GPT כדי להפיק את הציון בפועל. בנוסף, מדובר בפלטים של מודלים ממועד מסוים, כך שכל בדיקה תלויה באיכות ההרצה המקורית ובמבחנים שהיו זמינים עד יולי 2024.

שאלות
נפוצות

האם המאגר מתאים לאימון מודל ראייה שפה חדש?

לא, המאגר לא נועד לאימון בסיסי של מודלים ויזואליים. הוא מכיל קובצי אקסל עם תשובות טקסטואליות של מודלים קיימים לשאלות ממבחני ביצועים שונים, ולא אוסף תמונות וטקסט לאימון ראשוני.

האם יש תמיכה בעברית?

אין במאגר עברית כלל. כל הרשומות, השאלות והתשובות מבוססות על מבחנים שרצים באנגלית ובסינית בלבד.

האם מותר להשתמש בנתונים בפרויקט מסחרי?

רישיון המאגר הוא apache-2.0 ולכן מותר להשתמש בו לצרכים מסחריים. נדרש להקפיד על מתן קרדיט ליוצרים בהתאם לתנאי הרישיון, וכדאי לוודא את הרישיונות של מבחני המקור שנכללים בקבצים.

האם הציונים הסופיים מופיעים בתוך הקבצים?

לא, הקבצים מכילים את התחזיות הגולמיות בלבד. כדי להפיק ציון מספרי יש להריץ את פקודת ההערכה של VLMEvalKit, וחלק מהמבחנים דורשים הגדרת מפתח API של GPT לצורך החישוב.

איך טוענים

המאגר פתוח לציבור ללא צורך באישור גישה מיוחד. הוא מורכב מ־13,246 קבצים בפורמט אקסל, כך שלא טוענים אותו כטבלה אחת דרך ספריית הדאטהסטים הרגילה. כדי לעבוד איתו בצורה מובנית צריך להתקין את ספריית VLMEvalKit, לפתוח את מחברת RecordBroswer.ipynb או להריץ את כלי השורה vlmutil eval מול קובץ ה־xlsx הרלוונטי כדי לחשב ציונים בלי להריץ שוב את המודל.

from datasets import load_dataset

ds = load_dataset("VLMEval/OpenVLMRecords")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0, שמאפשר שימוש מסחרי ומחקר חופשי. הרישיון דורש מתן ייחוס למחברים ושמירה על תנאי הרישיון המקורי, אך אינו מחייב שיתוף באותו רישיון עבור תוצרים או מודלים שנבנו בעזרתו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗