GPT
E

EEE_datastore

קוד פתוח

evalevalmit2026-02-11

  • evaluation
  • benchmarks
  • leaderboards
  • model-evaluation
  • meta-evaluation

המאגר מרכז תוצאות הערכה של מודלי שפה ממקורות שונים לתוך סכמה אחידה. הוא מתאים למי שרוצה להשוות ביצועים מלוחות תוצאות וממאמרים בלי לגרד מחדש כל מקור בנפרד.

  • 13,916הורדות בחודש
  • 40לייקים

מה זה

המאגר כולל בין עשרת אלפים למאה אלף רשומות שמחולקות לפי אוספים בתיקיית data. כל רשומה נשמרת בקובץ JSON ומייצגת תוצאות הערכה למודל מסוים, ולצידה מופיע לעיתים קובץ JSONL עם דגימות ברמת הפרומפט, הפלט והניקוד הבודד. הרשומות מגיעות מגירוד של לוחות תוצאות, חילוץ ממאמרים אקדמיים, או הרצות מקומיות של כלי בדיקה.

המבנה הפנימי מארגן את הנתונים לפי מדדים מספריים, כיוון המדד, וסוג האינטראקציה, כולל שיחות מרובות שלבים ומעקב אחר הפעלת כלים. יש גם מראה שמנוהלת תחת flat עם תמונות מצב מאומתות גיבוב, ותצוגות Parquet מרודדות תחת viewer_parquets לחלק מהאוספים לצורך שאילתות מהירות.

מתאים ל

  • ניתוח השוואתי של בנצ'מרקים

    השוואת ביצועים מדווחים של מודלים שונים על פני עשרות מבחנים מוכרים בלי לגרד כל לוח בנפרד.

  • מעקב אחר הרצות סוכנים

    חקר שרשראות קריאה לכלים ותוצאות של מודלים במשימות מורכבות בעזרת קובצי הדגימות.

  • מחקר על אמינות הערכות

    בדיקת פערים בין דיווחי מפתחי המודלים לבין תוצאות של צדדים שלישיים באותם מדדים.

איפה זה נופל

הנתונים לא עברו אימות מחדש. התוצאות מדווחות מהמקורות שלהן, ורמת האמינות שלהן תלויה במי שפרסם אותן, במיוחד כשמפתח המודל בודק את עצמו. אין אחידות בשמות המודלים או בתיקיות האוספים, ויש כפילויות של בנצ'מרקים עם שמות שונים. אי אפשר להסתמך על זה כדירוג ישיר, כי תנאי ההרצה, הפרומפטים והפרמטרים שונים לחלוטין בין רשומות באותו אוסף. בנוסף, קובצי הדגימות מכילים טקסטים מקוריים של המבחנים, שרובם באנגלית וכוללים תנאי שימוש נפרדים.

שאלות
נפוצות

האם מותר להשתמש במידע לפיתוח מוצר מסחרי?

הרישיון של המאגר עצמו הוא MIT ומתיר שימוש מסחרי מלא. צריך לשים לב שקובצי הדגימות שמכילים את תוכן המבחנים עצמם כפופים למגבלות המקוריות של כל בנצ'מרק, ולכן שימוש בהם דורש בדיקה של תנאי המקור המצוינים ברשומה.

האם המאגר כולל הערכות בעברית?

החומרים נאספו בעיקר מבנצ'מרקים בינלאומיים מוכרים כמו GSM8K ו־GAIA, שהטקסטים וההרצות שלהם באנגלית. אין פירוט על תמיכה במבחנים ייעודיים בעברית, כך שלא כדאי לבנות עליו למדידת יכולות בשפה המקומית.

למה הצפייה במאגר באתר של Hugging Face לא עובדת?

הרשומות מכילות מבנה מקונן ושדות פתוחים כמו פרטי מודל נוספים, שמשתנים מאוסף לאוסף. המנוע של האתר לא מצליח להמיר את השדות האלה לסכמת Arrow אחידה, ולכן מומלץ לעבוד ישירות מול קובצי ה־JSON או Parquet דרך קוד.

איך המאגר מתעדכן ומה צריך לדעת על יציבות הנתונים?

חלק מהאוספים מתעדכנים באופן אוטומטי מלוחות התוצאות המקוריים, ותהליך זה דורס רשומות קיימות במקום להוסיף עליהן. למחקר שדורש שחזור מדויק, חובה לקבע את ה־commit hash הספציפי בקוד ולא לעבוד ישירות מול ענף main.

איך טוענים

טעינה רגילה דרך ספריית datasets עלולה להיכשל בגלל שדות פתוחים בעץ המבני, ותצוגת הנתונים באתר חסומה מאותה סיבה. הדרך היעילה לעבוד היא להוריד תת תיקייה ספציפית בעזרת snapshot_download עם סינון על שם האוסף המבוקש, או לתשאל ישירות קובצי Parquet באמצעות DuckDB. אם מושכים את כל 32,794 הקבצים, מתחילים מקובץ המניפסט flat/latest_manifest.json שמרכז את הנתיבים והגרסאות. нет דרישה לאישור גישה.

from datasets import load_dataset

ds = load_dataset("evaleval/EEE_datastore")

הרישיון

המאגר מופץ ברישיון MIT, מה שמתיר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים. הרישיון חל על מבנה הנתונים והאיחוד שלהם. קובצי הדגימות ברמת הדוגמה הבודדת כוללים פלטים ופרומפטים מתוך מבחני הבסיס המקוריים, והם כפופים לתנאי הרישיון של אותם מבחנים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗