GPT
D

DatBench-Full

קוד פתוח

DatologyAIרישיון לא דווח2026-01-01

מאגר הערכה מקיף למודלי ראייה-שפה שמנקה שאלות אמריקאיות, רעש ודליפות טקסטואליות מ־33 מבחנים שונים. הוא מיועד למי שרוצה לבדוק יכולת מולטימודלית אמיתית בלי קיצורי דרך של ניחוש או זיכרון.

  • 1,428הורדות בחודש
  • 77לייקים

מה זה

המאגר מאגד נתונים מ־33 מבחני ביצועים מקובלים בתחום הראייה והשפה ומחלק אותם לתשע יכולות ליבה שונות, כולל מתמטיקה, תרשימים, פענוח טקסט מתמונה, הבנה מרחבית ועיגון עצמים. במקום להשאיר את המבחנים המקוריים כמו שהם, הנתונים עברו תהליך עיבוד שכלל הפיכת שאלות רב-ברירה לשאלות גנרטיביות פתוחות, כדי למנוע ניחושים והטיות של אפשרויות בחירה.

בנוסף, המפתחים השתמשו במודל שופט ובבדיקות מקדימות כדי לסנן שאלות שניתן לפתור מטקסט בלבד ללא התמונה, וכן שאלות עם שגיאות, ניסוחים מעורפלים או רזולוציה ירודה. גרסת הפול הזו כוללת את כל הדגימות האיכותיות ששרדו את שלושת שלבי הניקוי הראשונים, להבדיל מהגרסה המצומצמת שדוגמת רק חלק מהשאלות. במאגר יש 205 קבצים, והם מחולקים לפי תיקיות של יכולות שונות, כמו קובצי תרשימים בפורמט פרקט.

מתאים ל

  • הערכת עומק למודלי ראייה

    בדיקה יסודית של מודלים מולטימודליים בסוף תהליך הפיתוח ללא הטיות של שאלות אמריקאיות.

  • ניתוח שגיאות ביכולות ספציפיות

    זיהוי כשלים ממוקדים בתחומים מוגדרים כמו פענוח מסמכים, ניתוח תרשימים או חשיבה מרחבית.

  • מדידת תלות במרכיב החזותי

    אימות שהמודל אכן מתבסס על התמונה ולא עונה לשאלות מורכבות על סמך הטקסט בלבד.

איפה זה נופל

למרות הסינון המאסיבי, המאגר נשען על 33 מבחנים קיימים וירש חלק מהמגבלות שלהם. אין כאן נתונים בעברית, כל המשימות והטקסטים הם באנגלית, והיכולות נבדקות בהקשר תרבותי ולשוני מערבי. המפתחים עצמם הסירו דגימות בעייתיות, כמו שאלות ממבחן OCR-VQA שהסתמכו על מטא-דאטה של ספרים מאמזון במקום על קריאת הטקסט עצמו, ושאלות מרובות תמונות ממבחן MMMU-Pro, כך שתרחישים מרובי תמונות חסרים כרגע ביכולות הכלליות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

לא דווח רישיון בעמוד המאגר. מאחר שהוא מורכב מ־33 מבחנים שונים, לכל רכיב עשויים להיות תנאי רישוי משלו, ולכן שימוש מסחרי מסוכן ללא בדיקה משפטית של המקורות.

האם יש במאגר דוגמאות או שאלות בעברית?

לא, המאגר מתבסס על מבחני ראייה-שפה מובילים שכולם מנוסחים באנגלית בלבד. אם המוצר שלכם נדרש לפענוח מסמכים או חשיבה חזותית בעברית, תצטרכו לאסוף נתונים ייעודיים בנפרד.

מה ההבדל בין גרסה זו לגרסת DatBench הרגילה?

הגרסה הרגילה כוללת תת-קבוצה קטנה וממוקדת שנועדה לבדיקות מהירות בזמן אימון בריצה של פי 13 מהר יותר. גרסת הפול הזו שומרת את כל הדוגמאות שעברו את שלבי הסינון, ומתאימה לבדיקות מקיפות ודוחות סופיים.

איך נאספו וסוננו הנתונים במאגר?

הנתונים נלקחו מ־33 מבחני ראייה קיימים, הפכו לשאלות פתוחות, וסוננו באמצעות מודל שופט כדי להסיר שאלות פתירות ללא תמונה או שאלות עם מידע שגוי. בהמשך הוסרו גם דגימות ספציפיות כמו שאלות מרובות תמונות ושאלות שתלויות בזיכרון של קטלוגים חיצוניים.

איך טוענים

הנתונים מחולקים לקובצי Parquet לפי היכולות השונות, למשל קובצי תרשימים תחת התיקייה chart, לצד כלי הערכה ייעודי שהמפתחים פרסמו בגיטהאב. הגישה למאגר פתוחה ישירות ואינה דורשת אישור ידני. כדי להריץ בדיקות תקינות לפי המתודולוגיה של הפרויקט, צריך לשים לב לשדה מקור המידע, שכן דוגמאות מסוימות שמקורן במאגרים כמו VQA-v2 דורשות ניקוד באמצעות מודל שופט סמנטי ולא השוואת טקסט מדויקת.

from datasets import load_dataset

ds = load_dataset("DatologyAI/DatBench-Full")

הרישיון

הרישיון של המאגר לא דווח. בפועל, המשמעות היא שאין הרשאה מפורשת לשימוש מסחרי או לאימון מודלים, במיוחד לאור העובדה שמדובר באוסף שנגזר מ־33 מקורות שונים שלכל אחד מהם עשויים להיות תנאים משלו. מומלץ להשתמש בו לצורכי הערכה ומחקר בלבד, ולבדוק את תנאי המקור של כל מבחן לפני שילוב במוצר.

הרישיון המלא ב־Hugging Face ↗