GPT
A

AMO-Bench

קוד פתוח

meituan-longcatmit2025-10-29

  • Large Language Models
  • Reasoning Models
  • Mathematical Reasoning
  • mathematics

המאגר כולל 50 שאלות מתמטיות מקוריות ברמת אולימפיאדה בינלאומית, שנועדו לבחון יכולות חשיבה והסקה מתקדמות של מודלי שפה בלי חשש מזיהום נתונים.

  • 2,324הורדות בחודש
  • 37לייקים

מה זה

מדובר במבחן ביצועים שמורכב מ־50 שאלות שנכתבו במיוחד על ידי מומחי מתמטיקה ממוסדות אקדמיים, במטרה להציב רף קושי שמתחיל ברמה של אולימפיאדת המתמטיקה הבינלאומית. כל רשומה כוללת מזהה שאלה, ניסוח מלא בפורמט מרקדאון עם נוסחאות LaTeX, פתרון אנושי מפורט צעד אחר צעד, תשובה סופית בלבד, וסיווג סוג התשובה מתוך ארבעה סוגים אפשריים.

תהליך הסינון כלל ארבעה שלבים קפדניים, שכללו כתיבה עצמאית, ביקורת עמיתים עיוורת על ידי שלושה מומחים לפחות, בדיקת מקוריות מול חומרים קיימים ברשת, וסינון קושי בעזרת מודלי שפה כדי להבטיח שהשאלות לא ייפתרו בקלות. המבנה ממוקד בבדיקת תשובה סופית ולא בהוכחה שלמה, מה שמאפשר לבדוק את התוצאות בצורה אוטומטית בעזרת מפענח ייעודי עבור 39 מהשאלות או בעזרת שיפוט מודל שפה עבור היתר.

מתאים ל

  • בדיקת ביצועי קצה למודלים

    מדידת יכולת ההסקה המתמטית של מודלי שפה על שאלות ברמת IMO שלא נכללו באימון מוקדם.

  • ניתוח מסלולי פתרון

    שימוש בפתרונות האנושיים המפורטים לצורך הנדסת פרומפטים וניתוח טעויות הסקה של מודלים.

  • מדידת יעילות טוקנים

    בחינת כמות הטוקנים הנדרשת למודל בזמן ריצה כדי להגיע לתשובה נכונה בבעיות קשות.

איפה זה נופל

הבעיה המרכזית היא הגודל המזערי של 50 שאלות בלבד, כך שכל טעות בודדת משנה את הציון בשני אחוזים שלמים. למרות מאמצי המקוריות, בדיונים במאגר כבר התגלה ששאלה 26 זהה לשאלת תחרות קיימת, שאלות 38 ו־39 דומות מאוד למאמרים ב־arXiv, ובשאלה 35 התגלתה שגיאת ניסוח שתוקנה בדיעבד. הטקסט כולו באנגלית בלבד ללא שום ייצוג לעברית. בנוסף, ארבע שאלות דורשות חישובים מספריים כבדים שקשה למודלים לפתור בלי כלי חישוב חיצוניים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצרים מסחריים?

כן, הרישיון הוא MIT והוא מתיר שימוש מסחרי מלא ללא הגבלה. צריך רק לכלול את עותק הרישיון והקרדיט המקורי בפרויקט. אין שום דרישה לשחרר את המוצר או המודל שלכם כקוד פתוח.

כמה שטח אחסון המאגר דורש?

המאגר שוקל מעט מאוד וכולל קובץ פרקט יחיד ובו 50 שורות בלבד. ההורדה אורכת שניות ספורות ואינה דורשת משאבי חומרה או נפח דיסק משמעותיים. הוא מיועד להערכה מהירה ולא לאימון מסיבי.

האם יש במאגר תמיכה בשפה העברית?

לא, כל השאלות והפתרונות כתובים באנגלית בלבד וכוללים ביטויים מתמטיים בפורמט LaTeX. אם אתם בונים מודל שמיועד לשאלות בעברית, תצטרכו לתרגם את השאלות בעצמכם או לבדוק ביצועים במאגר אחר.

איך הנתונים נאספו ונבדקו?

מומחי מתמטיקה כתבו את השאלות מאפס יחד עם פתרון מלא. לאחר מכן עברו השאלות ביקורת עמיתים עיוורת על ידי שלושה מומחים, בדיקת מקוריות ברשת, וסינון קושי באמצעות מודלים כדי לוודא רמת אולימפיאדה.

במה המאגר שונה ממבחנים מוכרים כמו AIME?

מבחנים קיימים סובלים מרוויה ומדליפת נתונים בגלל שהשאלות שלהם כבר פורסמו ונכנסו לקובצי האימון של המודלים. כאן כל השאלות נכתבו מחדש כדי למנוע שינון, והרף הועלה לדרגת קושי של אולימפיאדה בינלאומית.

איך טוענים

הנתונים יושבים בקובץ פרקט יחיד בשם test-00000-of-00001.parquet ונגישים להורדה מיידית ללא צורך בהרשאה מוקדמת. כל המאגר כולל ארבעה קבצים בלבד, כך שהמשקל שלו זניח לחלוטין. כדי להריץ הערכה, מכינים קובץ תשובות של המודל בפורמט שורות JSON עם מזהה השאלה והפלט, ומריצים את סקריפט הבדיקה שמסופק במאגר הקוד הרשמי. חובה לשים לב לשדה התשובה הסופית, שמופיע לרוב בתוך תבנית boxed, ולהגדיר מפתחות גישה אם מפעילים בדיקה מבוססת מודל עבור שאלות שאינן נבדקות על ידי המפענח.

from datasets import load_dataset

ds = load_dataset("meituan-longcat/AMO-Bench")

הרישיון

המאגר מופץ ברישיון MIT, מה שמעניק חופש מלא לשימוש מסחרי, מחקרי, שינוי והפצה ללא הגבלות מיוחדות. הדרישה היחידה היא שמירת הודעת זכויות היוצרים והרישיון המקורי. הרישיון אינו כופה שיתוף באותו רישיון, ומודל שאומן או הוערך בעזרת הנתונים אינו מושפע ממגבלות קנייניות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗