GPT
J

jee-neet-benchmark

קוד פתוח

Reja1mit2025-05-04

  • education
  • science
  • india
  • competitive-exams
  • llm-benchmark

860 שאלות מקוריות מסרוקות מתוך מבחני הקבלה ההודיים JEE ו־NEET. המאגר מיועד לבדיקת יכולות הסקת מסקנות מתמטית ומדעית של מודלי שפה שרואים תמונות.

  • 3,952הורדות בחודש
  • 16לייקים

מה זה

המאגר מכיל 860 רשומות שמחולקות בין בחינות NEET ו־JEE Advanced בשנים 2024, 2025 ו־2026. כל רשומה כוללת את תמונת השאלה המקורית מתוך טופס הבחינה, לצד מטא-דאטה מפורט שכולל מזהה שאלה, שנה, נושא, סוג שאלה, מזהה שאלון ותשובה נכונה מאומתת.

המבנה מאוזן פנימית לפי מקצועות בכל שנתון. ב־NEET יש שאלות בפיזיקה, כימיה, בוטניקה וזואולוגיה או ביולוגיה, וב־JEE Advanced החלוקה שווה בין פיזיקה, כימיה ומתמטיקה. סוגי השאלות מגוונים וכוללים שאלות ברירה מרובה עם תשובה אחת, שאלות עם מספר תשובות נכונות, התאמת רשימות ושאלות חישוב שהתשובה להן היא מספר שלם או עשרוני.

מתאים ל

  • בנצ'מרק למודלי מולטימודל

    הרצת הערכה מובנית על שאלות ראייה מדעיות מורכבות בעזרת הסקריפטים של OpenRouter.

  • אימון וחידוד מודלים

    בניית מאגר כוונון מודלים לפתרון בעיות פיזיקה ומתמטיקה מתוך תרשימים וטקסט סרוק.

  • בדיקת חוסן לפתרון שאלות

    מדידת ביצועים על סוגי מענה מורכבים כמו ניקוד חלקי בשאלות רב-ברירה עם כמה תשובות.

איפה זה נופל

הבעיה המרכזית היא זיהום נתונים. מדובר במבחנים ציבוריים מוכרים שפורסמו ברשת בהיקף נרחב, ולכן סביר להניח שחלקם נכנסו לדאטהסט האימון של המודלים הגדולים, במיוחד בשנים המוקדמות. בנוסף, המבחנים הם באנגלית בלבד וכוללים תמונות בלבד ללא טקסט מופשט, מה שהופך את המדידה לרגישה מאוד לאיכות התמונה ויכולות הראייה של המודל ולא רק ליכולת החשיבה. תבנית הפרומפט קבועה מראש לכל סוג שאלה, ושאלות JEE Main מוגדרות בקוד אך אינן קיימות בפועל במאגר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר מופץ ברישיון MIT, מה שמתיר שימוש מסחרי מלא ללא תמלוגים. עם זאת, התמונות עצמן נלקחו מבחינות לאומיות רשמיות בהודו. לפני שמשלבים נתונים אלה במוצר סופי, כדאי לוודא שאין מגבלת זכויות יוצרים על חומרי המבחן המקוריים.

האם יש במאגר שאלות בעברית או תרגום שלהן?

המאגר כולו באנגלית בלבד. השאלות סרוקות ישירות מטופסי הבחינה המקוריים בשפה זו. כדי לבחון מודל בעברית תצטרכו להפעיל מודל ראייה שמתרגם את השאלה או להשתמש בבנצ'מרק אחר.

איך מחשבים את הציון של המודל?

המאגר כולל סקריפט הערכה שמיישם את שיטת הניקוד הרשמית של הבחינות. ב־NEET ניתנות 4 נקודות לתשובה נכונה והורדה של נקודה על שגיאה. ב־JEE Advanced מיושם מנגנון ניקוד חלקי לשאלות עם מספר תשובות נכונות, ושאלות שדולגו אינן גוררות קנס.

במה הוא שונה ממאגרי שאלות מדעיות כמו GPQA?

בשונה ממאגרים טקסטואליים, כאן כל שאלה מוגשת כתמונה מתוך הבחינה המקורית וכוללת שרטוטים, נוסחאות ותרשימים. מצד שני, כיוון שמדובר בבחינות עבר מוכרות, רמת הסיכון לזיהום נתונים גבוהה יותר מאשר במבחנים שנכתבו במיוחד עבור הערכת בינה מלאכותית.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets על ידי load_dataset בפיצול test, ללא צורך באישור גישה. אפשר גם למשוך אותו ישירות דרך git עם תמיכה ב־git-lfs, מכיוון שהתמונות נשמרות שם. כל רשומה מחזירה אובייקט תמונה ושדה תשובה נכונה שמקודד כמחרוזת JSON, כך שחובה להשתמש ב־json.loads כדי לחלץ את המערך. המאגר מכיל סקריפטים מובנים להרצה והערכה דרך ממשק ה־API של OpenRouter.

from datasets import load_dataset

ds = load_dataset("Reja1/jee-neet-benchmark")

הרישיון

המאגר מפורסם תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, מחקרי, שינוי והפצה מחדש, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף פרויקטים נגזרים באותו רישיון, ומודל שאומן או הוערך על בסיסו אינו מוגבל בהפצה מסחרית מבחינת תנאי הרישיון של המאגר עצמו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗