GPT
M

MathNet

קוד פתוח

ShadenAcc-by-4.02026-04-23

  • mathematics
  • olympiad
  • reasoning
  • competition-math
  • multimodal

מאגר של עשרות אלפי שאלות ופתרונות מלאים מאולימפיאדות מתמטיקה רשמיות ברחבי העולם. הוא מספק שאלות ברמת הוכחה עם שרטוטים מקוריים וחלוקה ל־17 שפות, בלי רעש של אתרי קהילה.

  • 40,577הורדות בחודש
  • 96לייקים

מה זה

בגרסה הנוכחית יש 27,817 בעיות שנאספו מ־1,595 חוברות רשמיות של תחרויות ב־47 מדינות, לאורך השנים 1985 עד 2025. חלק מהחוברות נסרקו ידנית ישירות מארכיונים אישיים. כל רשומה כוללת מזהה, מדינה, שם תחרות, נוסח השאלה בפורמט מרקדאון ולייטך, ופתרונות מלאים ומפורטים שנכתבו על ידי מומחים, ולא תשובות סופיות קצרות בלבד. 5,148 מהשאלות כוללות שרטוטים, עם 7,541 תמונות שמיושרות ישירות מול גוף הטקסט.

עיבוד הנתונים רץ דרך כלי ה־OCR בשם dots-ocr, חולק למקטעים עם Gemini 2.5 Flash, וחולץ ללייטך באמצעות GPT-4.1. הסינון כלל בדיקת דמיון מול הטקסט הגולמי, אימות תמונות מול צילומי מסמך באמצעות GPT-4.1 כבודק, וביקורת ידנית במקרים גבוליים. המאגר מכסה גאומטריה, אלגברה, תורת המספרים, קומבינטוריקה, חדו"א והסתברות, ומציע טקסונומיה היררכית לכל שאלה. 74% מהחומר באנגלית, והשאר ב־16 שפות נוספות כמו פורטוגזית, ספרדית, צרפתית, סינית וגרמנית.

מתאים ל

  • אימון מודלים ב־RL

    אימון חיזוק עם פתרונות ארוכים ומפורטים שמאפשרים לבנות משובי ביניים לתהליכי פתרון והוכחות.

  • הערכת הנמקה מולטי-מודלית

    בדיקת יכולת המודל לפענח שרטוטים גאומטריים מקוריים יחד עם טקסט ולבנות הוכחה מתמטית שלמה.

  • בנצ'מרק שאלות אולימפיאדה

    בחינת יכולות קצה במתמטיקה גבוהה בשפות שונות, תוך שימוש בסיווג הנושאי ההיררכי.

איפה זה נופל

הבעיה המרכזית היא זליגת נתונים. שאלות אולימפיאדה מפורסמות באינטרנט כבר עשרות שנים, כך שסביר להניח שרובן המוחלט כבר הופיע באימוני הבסיס של מודלים קיימים. בנוסף, השדות המגדירים את סוג הבעיה ואת התשובה הסופית חולצו על ידי מודל שפה ולא עברו אימות אנושי מלא, ולכן אינם אמינים כתוויות מוחלטות. עברית אינה מופיעה במאגר כלל, ורמת הקושי פונה באופן בלעדי למתמטיקה תחרותית גבוהה, ללא שאלות בסיסיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לאימון מודל מסחרי?

באופן כללי כן, תחת CC BY 4.0 שדורש ייחוס בלבד. עם זאת, היוצרים מדגישים שזכויות יוצרים ספציפיות שהוגדרו על ידי צוותים לאומיים מסוימים גוברות על הרישיון. מומלץ לסנן את השורות לפי שדה booklet_source ולוודא שאין שם מגבלות קניין רוחני פרטניות.

האם המאגר כולל תוכן בעברית?

לא. המאגר כולל 17 שפות מקור, בהן אנגלית שמהווה 74% מהחומר, וכן ספרדית, צרפתית, גרמנית, סינית ועוד. ישראל אינה ברשימת המדינות שנסרקו, ואין שאלות בעברית.

במה הוא שונה ממאגרים כמו GSM8K או MATH?

הוא קשה בהרבה ומכוון לרמת אולימפיאדות בינלאומיות ולא לרמת בית ספר. הפתרונות בו הם הוכחות ארוכות שנכתבו על ידי מומחים ולא תשובות קצרות, והוא מכיל אלפי שרטוטים מקוריים ותמיכה בריבוי שפות ישירות ממסמכי המקור.

האם ניתן להסתמך על שדה התשובה הסופית כבסיס להערכה אוטומטית?

לא מומלץ להסתמך עליו בעיניים עצומות. היוצרים מבהירים כי סוג הבעיה והתשובה הסופית נגזרו באמצעות מודל שפה ולא עברו אימות אנושי מקיף. לצורך בנצ'מרק מדויק עדיף להעריך מול הפתרון המלא או לבצע אימות מדגמי.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face. הגישה פתוחה לחלוטין וללא צורך באישור. המאגר מחולק ל־58 תצורות לפי מדינה או גוף אזורי, לצד תצורת all שמכילה את כל הנתונים. שים לב שבגרסה הזו כל תצורה מגיעה כולה תחת חלוקת train בודדת, כך שאם אתה מתכנן הערכה, תצטרך לבצע את החלוקה בעצמך. עמודת images מכילה רשימות של אובייקטי PIL שמתאימים לתגי התמונות בטקסט, ועמודות הפתרונות הן רשימות מחרוזות.

from datasets import load_dataset

ds = load_dataset("ShadenA/MathNet")

הרישיון

המאגר מופץ תחת רישיון CC BY 4.0 שמתיר שימוש מסחרי, מחקרי, שינוי והפצה, בתנאי של מתן קרדיט מתאים ליוצרים. עם זאת, היוצרים מציינים שבמקרים שבהם מדינה או ארגון תחרות מסוים הגדירו זכויות יוצרים מפורשות על החוברת המקורית, זכויות אלו קודמות לרישיון. חובה לבדוק את שדות המקור והתחרות בכל שורה לפני אימון מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗