GPT
H

hendrycks-MATH-benchmark

קוד פתוח

nlileרישיון לא דווח2024-11-03

מאגר בעיות מתמטיקה מתחרויות תיכון עם פתרונות מלאים צעד אחר צעד. מי שבונה מודל להסקה לוגית או מתמטית ירצה אותו בדיוק בגלל הפירוט של שלבי הפתרון והתיוג המדויק לפי רמות קושי.

  • 13,264הורדות בחודש
  • 32לייקים

מה זה

במאגר יש 12,500 בעיות מתמטיקה שנלקחו מתחרויות מוכרות כמו AMC 10, AMC 12 ו־AIME. הרשומות לא בודקות יכולת חישוב טכנית אלא חשיבה מתמטית עמוקה, ומכסות שבעה נושאים: קדם-אלגברה, אלגברה, אלגברה בינונית, תורת המספרים, קומבינטוריקה והסתברות, גיאומטריה וקדם-חשבון אינפיניטסימלי.

כל רשומה מורכבת מניסוח הבעיה, פתרון מלא עם כל שלבי הדרך, תשובה סופית בפורמט אחיד, שיוך לנושא ורמת קושי שמוגדרת מ־1 עד 5. הטקסט כולו כולל שימוש בסימוני LaTeX כדי לשמור על דיוק הנוסחאות.

החלוקה כאן אינה שוויונית. מתוך 12,500 הבעיות, 12,000 נמצאות בחלק האימון ורק 500 שמורות למבחן. זה אומר שרוב החומר פתוח ללמידה, אבל סט הבדיקה קומפקטי יחסית.

מתאים ל

  • אימון שרשרת חשיבה

    לימוד מודלים לפתור בעיות מורכבות בעזרת הפתרונות המפורטים צעד אחר צעד.

  • הערכת ביצועי מודל

    בדיקת יכולות הסקה מתמטית על סט המבחן לפי רמות קושי מ־1 עד 5.

  • סינון לפי נושאים

    בניית סטים ממוקדים בגיאומטריה או תורת המספרים מתוך שבעת התחומים הזמינים.

איפה זה נופל

הבעיות מגיעות מתחרויות אמריקאיות, כך שכל הטקסט באנגלית בלבד ואין פה אף מילה בעברית. המקורות הם מבחנים כמו AMC ו־AIME, מה שמציב רף כניסה קשה מאוד שלא מייצג מתמטיקה יומיומית או שאלות מילוליות פשוטות. בנוסף, חלוקת המבחן קטנה מאוד, 500 בעיות בלבד, מה שמקשה על הערכה סטטיסטית רחבה אם רוצים לבדוק חיתוכים לפי כל אחת מחמש דרגות הקושי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ לעשות זאת כרגע. המעלה לא הגדיר רישיון בקבצי המאגר, ולכן אין היתר שימוש מסחרי רשמי. עבור פרויקטים פנימיים או מחקר זה פחות בעייתי, אבל למוצר מסחרי דרוש רישיון ברור.

האם יש במאגר שאלות בעברית?

אין במאגר עברית בכלל. כל הבעיות והפתרונות כתובים באנגלית בלבד, ומבוססים על תחרויות מתמטיקה בארצות הברית. אם רוצים להשתמש בזה למודל בעברית, תצטרכו לתרגם את הטקסט בעצמכם תוך שמירה על תגיות ה־LaTeX.

מאיפה הנתונים נאספו במקור?

השאלות נלקחו ישירות מתחרויות מתמטיקה ברמת תיכון בארצות הברית, כולל AMC 10, AMC 12 ו־AIME. החוקרים ליקטו את השאלות, הצמידו להן פתרונות מפורטים ותייגו אותן לפי רמת קושי ונושא.

כמה קבצים יש במאגר ואיך הם מאורגנים?

המאגר כולל ארבעה קבצים בסך הכל. הנתונים עצמם מחולקים לשני קבצי parquet, אחד לקבוצת האימון שמכילה 12,000 שאלות, ואחד לקבוצת המבחן עם 500 השאלות הנותרות, לצד קובץ README.

איך טוענים

טוענים אותו ישירות דרך ספריית datasets באמצעות המזהה nlile/hendrycks-MATH-benchmark. המידע מגיע בשני קבצי parquet, אחד לאימון ואחד למבחן, כך שלא צריך להתמודד עם פריסה ידנית או אישורי גישה מיוחדים. שימו לב שהשדות מכילים נוסחאות בפורמט LaTeX, לכן נדרש עיבוד מקדים אם המודל שלכם לא מורגל בטקסט מתמטי כזה, ומומלץ לחלץ מראש את רמת הקושי והתחום כדי לסנן דוגמאות לפי הצורך.

from datasets import load_dataset

ds = load_dataset("nlile/hendrycks-MATH-benchmark")

הרישיון

המעלה לא דיווח על רישיון בעמוד המאגר. מבחינה משפטית, היעדר רישיון מוגדר משמעותו שכל הזכויות שמורות ואין אישור מפורש לשימוש מסחרי או לאימון מודלים שמיועדים להפצה. שימוש בנתונים אלה למטרות מחקר אקדמי הוא המרחב הבטוח היחיד כרגע, וכל שילוב שלהם במוצר מסחרי כרוך בסיכון של הפרת זכויות יוצרים.

הרישיון המלא ב־Hugging Face ↗