GPT
R

ResearchMath-14k

קוד פתוח

amphoramit2026-05-28

  • mathematics
  • research-problems
  • open-problems
  • arxiv
  • reasoning

המאגר כולל 14,056 שאלות מחקר במתמטיקה מתקדמת שנאספו ממאמרים אקדמיים. הוא פונה למי שמחפש בעיות ברמה מחקרית ולא תרגילי תיכון או תואר ראשון.

  • 480הורדות בחודש
  • 57לייקים

מה זה

הרשומות מציגות בעיות מתמטיות ברמת מחקר שנמשכו מתוך מאמרים, רשימות בעיות פתוחות ודפי סדנאות אקדמיות. תהליך הבנייה הסתמך על שני סוכנים. סוכן אחד איתר שאלות מועמדות במקורות הכתובים, וסוכן שני אימת את הסטטוס שלהן, שייך אותן לתחומי ידע וניסח אותן מחדש כבעיות עצמאיות שלא דורשות את כל המאמר המקורי כדי להבין את הניסוח.

התוכן מחולק לאחד עשר תחומים שונים. הנתח הגדול ביותר שייך לאנליזה, משוואות דיפרנציאליות חלקיות ומערכות דינמיות עם 3,197 בעיות. פיזיקה מתמטית כוללת 2,031 בעיות, מתמטיקה בדידה וקומבינטוריקה מכילות 1,897, וגיאומטריה וטופולוגיה 1,846. תחומים כמו תורת המספרים, מדעי המחשב התיאורטיים ולוגיקה מופיעים במספרים נמוכים יותר, בין מאות בודדות לאלף רשומות לכל תחום.

מתאים ל

  • אימון הבנת בעיות מחקר

    לימוד מודלים לפרק ולהבין ניסוחים מתמטיים מורכבים ברמה אקדמית.

  • יצירת פרומפטים מורכבים

    בניית שאלות עצמאיות לאימון תהליכי חשיבה והסקה ארוכים במתמטיקה.

  • הערכת יצירת כיווני פתרון

    בחינת היכולת של מודלים להציע שלבי הוכחה לבעיות מתמטיות פתוחות.

איפה זה נופל

כל הטקסטים נאספו באנגלית בלבד ואין במאגר עברית בכלל. הנקודה הקריטית ביותר היא מצב הפתרון. 59.14% מהשאלות מוגדרות פתוחות, ורק 8.33% מוגדרות פתורות, כשעוד 17.71% מוגדרות בסטטוס לא ידוע. זה אומר שלרוב המוחלט של הרשומות אין פתרון מלא מוכח. אם אתם מחפשים דאטהסט עם תשובות נכונות סופיות לצורך בדיקה אוטומטית פשוטה, זה לא המקום. בנוסף, הניסוח מחדש בוצע על ידי מודלים אוטונומיים, כך שייתכנו אי דיוקים בהגדרה המתמטית ביחס לכוונת הכותב המקורי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. הרישיון הוא MIT, והוא מתיר שימוש מסחרי מלא, שינוי והפצה. החובה היחידה היא לצרף את נוסח הרישיון המקורי והודעת הזכויות.

האם יש במאגר שאלות בעברית?

לא. כל 14,056 השאלות נאספו ממאמרים ודפי עבודה אקדמיים באנגלית בלבד. מי שצריך עבודה בעברית יצטרך לתרגם את הנתונים בעצמו.

האם לכל שאלה יש פתרון מצורף?

לא. רוב הבעיות במאגר, למעלה מ־59 אחוזים, הן שאלות מחקר פתוחות שטרם נפתרו, ורק לחלק קטן של קצת יותר מ־8 אחוזים יש פתרון ידוע. המאגר מיועד לניסוח שאלות ולהסקה, ולא למדידת נכונות של תשובה סופית קצרה.

איך נאספו ונוסחו השאלות?

החוקרים הפעילו מערכת של שני סוכנים. הראשון סרק מאמרים ורשימות בעיות וחילץ שאלות מועמדות, והשני בדק את מצב הבעיה, סיווג אותה לפי נושא וניסח אותה מחדש כשאלה עצמאית.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets בפייתון עם ציון המזהה amphora/ResearchMath-14k והספליט train. הקבצים יושבים בפורמט jsonl בתיקיית data ואין צורך בבקשת גישה מיוחדת או באישור ידני. בכל שורה תמצאו את נוסח השאלה המקורי, את הניסוח העצמאי שעבר שכתוב, תגיות של הטקסונומיה לפי תחום, ומידע מטא-דאטה לגבי מצב הפתרון של הבעיה.

from datasets import load_dataset

ds = load_dataset("amphora/ResearchMath-14k")

הרישיון

המאגר מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במוצרים סגורים. אין חובה לשתף נגזרות תחת אותו רישיון. תנאי השימוש דורשים רק שמירה על הודעת זכויות היוצרים והרישיון המקורי, ואפשר לאמן עליו מודלים חופשיים או מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗