GPT
B

BLINK

קוד פתוח

BLINK-Benchmarkapache-2.02024-04-04

המאגר מרכז מבחני ראייה ממוחשבת קלאסיים שבני אדם פותרים ברגע ומודלים רב מודליים מתקשים בהם מאוד. הוא נועד להעריך יכולות תפיסה חזותית אמיתית שלא נשענות רק על שפה.

  • 12,209הורדות בחודש
  • 49לייקים

מה זה

הנתונים מחולקים ל־14 משימות שונות שמבוססות על בעיות ראייה ממוחשבת מוכרות. המשימות כוללות אומדן עומק יחסי, התאמה חזותית, זיהוי זיופים בתמונות, ספירה, מבחני צורות, והבנה מרחבית. בסך הכל יש כאן 3,807 שאלות אמריקאיות, כאשר לכל שאלה מצורפת תמונה בודדת או כמה תמונות יחד עם סימונים חזותיים בגוף התמונה.

המאגר מפוצל לשני חלקים עיקריים. סט האימות מכיל 1,901 שאלות וכולל את התשובות הנכונות, הפרומפטים ששימשו במחקר והתחזיות של מודלי הבסיס. סט המבחן מכיל 1,907 שאלות שפורסמו ללא התשובות, והערכה שלו מתבצעת חיצונית.

המקורות מגיעים ממאגרי תמונות קיימים שנבנו בעבר למחקר בראייה ממוחשבת. היוצא דופן הוא תחום זיהוי הזיופים, שבו החוקרים אספו תמונות ידנית מחיפושים פומביים ברשת והתאימו אותן למבנה של שאלות ברירה מרובה.

מתאים ל

  • הערכת עומק ותפיסה מרחבית

    בדיקת יכולת המודל להבין יחסי מרחק ומיקום יחסי בין עצמים בתמונות נתונות.

  • מדידת עמידות לזיופי תמונה

    בחינה אם המודל מסוגל לזהות עריכות ומניפולציות ויזואליות שבוצעו על תמונות רשת.

  • השוואת מודלים למדדי בסיס

    הרצת סט האימות כדי לבדוק ביצועי מודל פיתוח מול תוצאות של מערכות מובילות.

איפה זה נופל

המאגר מיועד לבדיקה ולא לאימון רחב, בגלל כמות הדוגמאות הקטנה יחסית בכל קטגוריה. התמונות נאספו ממאגרי עבר ומחיפושים באינטרנט, כך שהן לא מייצגות את כל מגוון המצבים בעולם האמיתי. הטקסט והשאלות כתובים באנגלית בלבד. בנוסף, סט המבחן סגור, ולכן אי אפשר לנתח טעויות באופן עצמאי על חצי מהנתונים בלי להסתמך על מערכת חיצונית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

רישיון המאגר עצמו הוא apache-2.0 ומאפשר שימוש מסחרי חופשי בקוד ובמבנה הנתונים. עם זאת, החוקרים מציינים שחלק מהתמונות נאספו ברשת או ממאגרים אחרים, ולכן זכויות היוצרים על התמונות עצמן עשויות להיות כפופות לדרישות של בעלי הזכויות המקוריים. מומלץ לבדוק את מקורות התמונות לפני שילוב ישיר במוצר.

האם יש במאגר תמיכה בעברית?

אין במאגר תמיכה בעברית. כל השאלות, התשובות וההנחיות החזותיות מנוסחות באנגלית בלבד. אם רוצים לבדוק מודל בעברית, צריך לתרגם את השאלות מראש תוך התאמה לסימונים שעל גבי התמונות.

מה ההבדל בינו לבין בנצ'מרקים רב מודליים אחרים?

בנצ'מרקים רגילים מתמקדים בעיקר בזיהוי עצמים, קריאת טקסט מתוך תמונה וידע כללי שנשען על שפה. המאגר הזה מתמקד במשימות תפיסה בסיסיות של ראייה ממוחשבת, כמו הערכת עומק, ספירה והתאמה גאומטרית, שבני אדם קולטים בשבריר שנייה אך מודלי שפה רב מודליים מתקשים בהן.

איך משיגים את התשובות לסט המבחן?

התשובות לסט המבחן אינן זמינות להורדה ולא מופיעות בקבצים של המאגר. כדי לדעת את הציון בחלק זה, מריצים את המודל על השאלות ושולחים את קובץ התחזיות לבדיקה בפלטפורמת EvalAI.

איך טוענים

הטעינה נעשית דרך ספריית datasets הרגילה, ומחייבת לציין את שם תת-המשימה הרצויה מתוך 14 האפשרויות, כמו Counting או Relative_Depth. הנתונים מאוחסנים ב־34 קובצי parquet, שכוללים קובץ אימות וקובץ מבחן לכל משימה. הגישה פתוחה לחלוטין ללא צורך בהרשמה מוקדמת או אישור ידני. אם המטרה היא להעריך מודל על סט המבחן, התשובות אינן בקבצים וצריך להגיש את הפלטים ישירות לפלטפורמת EvalAI.

from datasets import load_dataset

ds = load_dataset("BLINK-Benchmark/BLINK")

הרישיון

המאגר מופץ תחת רישיון apache-2.0, שמתיר שימוש מסחרי, שינוי והפצה של הקוד והנתונים ללא חובת שיתוף תחת אותו רישיון. נדרש לתת קרדיט ליוצרים ולכלול עותק של הרישיון. עם זאת, היוצרים מבהירים שהתמונות עצמן נלקחו ממקורות חיצוניים ומחיפושים ברשת, כך שזכויות היוצרים על חלק מהתמונות עשויות להיות כפופות לתנאים המקוריים שלהן.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗