GPT
D

DatBench

קוד פתוח

DatologyAIרישיון לא דווח2026-01-01

מאגר מבחנים מסונן למודלי ראייה ושפה שמנקה שאלות אמריקאיות ורעשי רקע מ־33 מקורות קיימים. הוא מקצר זמני בדיקה סביב פי 13 ומסיר שאלות שהמודל יכול לנחש רק מהטקסט בלי להביט בתמונה.

  • 687הורדות בחודש
  • 108לייקים

מה זה

המאגר כולל נתונים להערכת מודלי ראייה ושפה המכסים 9 יכולות יסוד, ביניהן זיהוי תווים אופטי, ניתוח גרפים, עיגון ויזואלי, מתמטיקה והסקה מרחבית. במקור הדגימות נאספו מ־33 מבחני ביצועים נפוצים, ועברו עיבוד שמרחיק שאלות רב-ברירה והופך אותן למשימות ייצור טקסט חופשי כדי למנוע ניחושים והטיות.

תהליך הסינון כלל ארבעה שלבים קפדניים. תחילה הוסרו שאלות שניתן לפתור ללא שימוש בתמונה על בסיס הטקסט בלבד, לאחר מכן סוננו שגיאות תיוג ודגימות ברזולוציה נמוכה באמצעות מודל שופט, ולבסוף נבחרו הדגימות בעלות יכולת ההפרדה הגבוהה ביותר. המאגר מציע גרסה תמציתית להרצה מהירה וגרסה מלאה עם כל הדגימות האיכותיות ששרדו את הסינון.

מתאים ל

  • הערכה מהירה בלולאת אימון

    הרצה מהירה פי 13 של מבחני ראייה ושפה בזמן אימון כדי לבדוק גרסאות ביניים בלי לשרוף שעות מחשוב יקרות.

  • ניתוח יכולות OCR ותרשימים

    בדיקת יכולת המודל לקרוא מסמכים ולנתח גרפים ללא סכנה של הסתמכות על תיוג שגוי או זיכרון עיוור של טקסטים.

  • השוואת ביצועים לפני פריסה

    שימוש בגרסה המלאה לבדיקת ביצועים מעמיקה וזיהוי פערים ביכולת הסקה מרחבית לפני שחרור מודל ראייה.

איפה זה נופל

המאגר אינו מכיל נתונים בעברית ומבוסס על מבחני ראייה קיימים באנגלית. היוצרים הסירו במפורש דוגמאות מסוימות, כגון שאלות מרובות תמונות מתוך MMMU-Pro ונתונים מ־OCR-VQA, לאחר שהתברר שהתשובות בהם הסתמכו על זיכרון של קטלוגים חיצוניים ולא על קריאת התמונה בפועל. בנוסף, ההסתמכות על מודל שופט בשלב הסינון עלולה לשמר הטיות מערכתיות של מודלים קיימים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

לא דווח רישיון עבור המאגר הזה. בנוסף לכך שהוא נגזר מ־33 מבחנים שונים שלכל אחד מהם רישיון מקורי, ללא הצהרה מפורשת אסור להניח שמותר להשתמש בו למוצר מסחרי.

האם המאגר רלוונטי למודלים שעובדים בעברית?

הנתונים נאספו ממבחני ביצועים בינלאומיים באנגלית. הוא יכול לבדוק את יכולות הראייה וההסקה הכלליות של המודל שלכם, אך לא יספק מידע על ביצועי שפה או OCR בעברית.

במה הוא שונה מהמבחנים המקוריים כמו VQA או MMMU?

המבחנים המקוריים מלאים ברעש, ניחושים בשאלות אמריקאיות ושאלות שניתן לפתור בלי לראות את התמונה. המאגר הזה מסיר את הקיצורים הללו ומאלץ את המודל לענות בטקסט חופשי.

איך טוענים

הקבצים שמורים בפורמט Parquet בחלוקה לפי יכולות, למשל תיקיות ייעודיות לתרשימים, כפי שניתן לראות בקובצי הבדיקה השונים. טוענים אותם באמצעות ספריות תואמות Hugging Face או ישירות לקוד ההערכה הרשמי שהיוצרים פרסמו ב־GitHub. המאגר ציבורי ואינו דורש אישור גישה מראש, אך יש לשים לב לשדות מקור הנתונים, שכן דגימות מסוימות, כגון אלו שהגיעו מ־VQA-v2, דורשות שיטת ניקוד ייעודית מבוססת שופט סמנטי.

from datasets import load_dataset

ds = load_dataset("DatologyAI/DatBench")

הרישיון

היוצרים לא דיווחו על רישיון שימוש בעמוד המאגר. בהיעדר רישיון מוגדר, מבחינה משפטית כל הזכויות שמורות ולא מומלץ להשתמש בנתונים לצרכים מסחריים או לאמן עליהם מוצרים מסחריים לפני קבלת הבהרה רשמית, במיוחד כשהחומרים נגזרו מ־33 מקורות חיצוניים עם תנאים משלהם.

הרישיון המלא ב־Hugging Face ↗