GPT
O

OlympiadBench

קוד פתוח

Hothanapache-2.02024-07-16

  • math
  • physics

מאגר שאלות אולימפיאדה במתמטיקה ופיזיקה שכולל טקסט ותמונות להסקה מורכבת. הוא מיועד למי שרוצה לבחון יכולות חשיבה קיצוניות שרוב המודלים הגדולים עדיין נכשלים בהן לחלוטין.

  • 26,657הורדות בחודש
  • 47לייקים

מה זה

המאגר כולל 8,476 בעיות ברמת אולימפיאדות במתמטיקה ובפיזיקה, יחד עם שאלות מבחינות הכניסה לאוניברסיטאות בסין. כל שאלה מגיעה עם פירוט של שלבי הפתרון שנכתב בידי מומחים, כך שלא מדובר רק בתשובות סופיות אלא בשרשרת חשיבה מלאה. החומר מחולק לפי שפות, מקצועות וסוג הקלט.

מבנה הקבצים מפריד בין בעיות טקסטואליות בלבד לבין בעיות מולטימודליות שכוללות תמונות ודיאגרמות. החלוקה הפנימית מפצלת את הנתונים לפי אנגלית וסינית, וכן לפי מקור השאלות, תחרויות מדעיות או בחינות הקבלה הסיניות. בגלל רמת הקושי הגבוהה, מודלים חזקים כמו GPT-4V הגיעו בו לממוצע של 17.97 אחוזים בלבד בכלל השאלות, ורק 10.74 אחוזים בפיזיקה.

במאגר עצמו יש עשרים קבצי נתונים, שכוללים סטים שונים של מתמטיקה ופיזיקה בשתי השפות. הנתונים מתמקדים ביכולת מענה על שאלות חזותיות ומילוליות שמצריכות הבנה מעמיקה של חוקי טבע ומשוואות מורכבות, ולא בשאלות ידע כללי פשוטות שניתן לשלוף מהזיכרון.

מתאים ל

  • מבחן ביצועים למודלי ראייה

    בדיקת יכולת פענוח תרשימים ופתרון בעיות פיזיקה מורכבות המשלבות תמונה וטקסט.

  • אימון שלבי הסקה מורכבים

    שימוש בפתרונות המפורטים כדי ללמד מודלים לייצר שרשרת חשיבה מתמטית מדויקת.

  • השוואת מודלים בשפות שונות

    בדיקת פער הביצועים של מערכות מדעיות בין השפה האנגלית לשפה הסינית.

איפה זה נופל

המאגר מוגבל לשתי שפות בלבד, אנגלית וסינית, כך שאין כאן שום תמיכה בעברית. שאלות רבות נשענות ישירות על תוכנית הלימודים ובחינות הכניסה בסין, מה שמייצר הטיה מקומית באופי השאלות ובסגנון הניסוח. בנוסף, קיימת בעיה מוכרת בתמונות של חלק מפתרונות הפיזיקה באנגלית שתוקנה רק בחלקה, וחלק מהתמונות המלאות לא נמצאות ישירות בקבצי המאגר אלא דורשות משיכה נפרדת.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. רישיון apache-2.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים שיוטמעו במוצרים סגורים. הדרישה העיקרית היא השארת הודעת זכויות היוצרים והרישיון המקורי.

האם יש במאגר שאלות בעברית?

לא. המאגר מכיל אך ורק שאלות באנגלית ובסינית. כדי להשתמש בו עבור מודלים בעברית תצטרכו לתרגם את השאלות ואת שלבי הפתרון בעצמכם.

מאיפה הגיעו השאלות והפתרונות?

הנתונים נאספו מתחרויות אולימפיאדה רשמיות במתמטיקה ובפיזיקה, וכן מבחינות הכניסה הסיניות לאוניברסיטאות. שלבי הפתרון המפורטים נכתבו ונבדקו על ידי מומחים בתחומים אלה.

למה חלק מהתמונות לא מופיעות ישירות בקבצים?

בגלל מגבלות טכניות בהצגת תמונות באתר, תמונות מסוימות ששייכות להסברי הפתרונות הוסרו מקבצי הפרקט. מי שזקוק לפתרונות החזותיים המלאים צריך להוריד את הקובץ החיצוני שסופק בקישור של צוות הפיתוח.

איך טוענים

הנתונים יושבים בעשרים קבצי Parquet ישירות במאגר, ואין צורך בבקשת גישה מיוחדת או באישור ידני כדי להוריד אותם. השדות המרכזיים כוללים את השאלה, שלבי הפתרון והתמונות הנלוות עבור המשימות המולטימודליות. מי שצריך את התמונות שמשולבות בתוך שלבי הפתרון עצמם צריך להוריד עותק מלא חיצוני מקישור הדרייב שהיוצרים סיפקו, כי הן הושמטו מהקבצים באתר בגלל מגבלות תצוגה.

from datasets import load_dataset

ds = load_dataset("Hothan/OlympiadBench")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה של הנתונים, כולל אימון והערכה של מודלים פנימיים או מסחריים. התנאי העיקרי הוא מתן קרדיט מתאים ליוצרים ושמירה על תנאי הרישיון המקוריים בקבצים שמופצים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗