GPT
U

UnsolvedMath

קוד פתוח

ulamaicc-by-4.02026-01-24

  • mathematics
  • unsolved-problems
  • math
  • research
  • latex

מאגר שמקבץ 15,458 בעיות מתמטיות פתוחות ולא פתורות ברמות קושי שונות. הוא מיועד למי שמחפש לבחון יכולות הסקה ופתרון בעיות אמיתיות שמעבר לבנצ'מרקים הרגילים.

  • 7,349הורדות בחודש
  • 77לייקים

מה זה

הרשומות במאגר מייצגות בעיות מתמטיות פתוחות, פתורות בחלקן או כאלה שנפתרו בעבר בספרות המקצועית. כל רשומה מכילה ניסוח מתמטי מלא בסימון LaTeX, רקע היסטורי, שיוך לאחת מתוך 17 קטגוריות מתמטיות כמו טופולוגיה או תורת המספרים, דירוג קושי בחמש רמות וסטטוס פתרון עדכני. חלק מהרשומות כוללות גם דוחות מחקר מובנים עם סיכומי ספרות וניסיונות פתרון אוטומטיים.

איסוף הנתונים נשען על מקורות מגוונים, בהם אוספים היסטוריים מפורסמים כמו בעיות המילניום ובעיות הילברט, וכן רשימות מודרניות מתוך AMR, סדנאות AIM ודוחות Oberwolfach Reports. הסינון שנעשה כולל ביקורת על שחזור ניסוחי הבעיות ב־AIM, לצד בדיקות ספרות ממוחשבות ותיוג מצב הפתרון בגרסאות המאוחרות של המאגר.

מתאים ל

  • הערכת מודלי הסקה מתקדמים

    בחינת יכולת ההתמודדות של מודלים מול בעיות פתוחות ומורכבות בעזרת ניסוחי הבעיה בשדה statement.

  • אימון עיבוד נוסחאות מתמטיות

    הזנת הטקסטים העשירים בסימון LaTeX כדי לשפר הבנה וייצור של ביטויים מתמטיים בסביבות קוד ומחקר.

  • סיווג אוטומטי של בעיות

    אימון מסווגים לחלוקת בעיות לפי 17 התחומים המתמטיים ורמות הקושי המוגדרות במאגר.

איפה זה נופל

חלק גדול מהתיוגים והפתרונות הופק על ידי מודלים של בינה מלאכותית ולא עבר ביקורת עמיתים אנושית, ולכן אי אפשר להסתמך עליהם בעיניים עצומות. קיימת הטיה מובהקת ברמות הקושי, כאשר רוב מוחלט של הבעיות משויך כברירת מחדל לרמה L3. החומר כולו באנגלית ובסימון LaTeX שמחייב ניקוי או עיבוד מקדים לפני הזנה למודל, ובמדגם של דוחות OWR אף נמצאו חילוצים משובשים של טקסט.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

רישיון המאגר המדווח הוא CC BY 4.0 שמתיר שימוש מסחרי עם מתן קרדיט מתאים. יחד עם זאת, חלק מהרשומות שמקורן בסקירות Oberwolfach כפופות לרישיון מחמיר יותר מסוג CC BY-SA 4.0. המשמעות היא שצריך לבודד את מקורות המידע לפני שמשלבים אותם במוצר מסחרי סגור.

האם המאגר כולל תוכן בעברית?

לא, כלל הבעיות וההסברים כתובים באנגלית בלבד. הניסוחים המתמטיים משלבים סימון בפורמט LaTeX. אם אתם זקוקים לתוכן בעברית, תצטרכו לתרגם את הניסוחים באופן עצמאי.

איך נאספו הבעיות המופיעות במאגר?

הנתונים לוקטו מתוך אוספי בעיות מתמטיות מוכרים כמו בעיות המילניום, רשימות סדנאות AIM ודוחות Oberwolfach Reports. בהמשך בוצע תהליך בדיקה וסינון בעזרת סוכני בינה מלאכותית שסרקו את הספרות המתמטית וסיווגו את מצב הפתרון הנוכחי.

מה ההבדל בין מאגר זה למאגרי מתמטיקה סטנדרטיים?

בניגוד למאגרים של שאלות בית ספר או מבחנים עם פתרונות ידועים מראש, כאן מדובר בבעיות מחקר פתוחות או פתורות בחלקן בחזית המדע. רמת הקושי בהתאם גבוהה משמעותית, ומרבית הבעיות דורשות ידע מתמטי מתקדם של חוקרים ולא פתרון טריוויאלי.

איך טוענים

טוענים את המאגר ישירות בעזרת הספרייה datasets של Hugging Face דרך קובצי JSON ספציפיים, למשל problems.json עבור הבעיות או dataset.json לקובץ המשולב. אין צורך באישור גישה מיוחד, המאגר פתוח לחלוטין להורדה. השדות המרכזיים שתרצו למשוך הם statement שמחזיק את נוסח הבעיה, difficulty שמגדיר את הרמה ו־status המעיד אם הבעיה עדיין פתוחה.

from datasets import load_dataset

ds = load_dataset("ulamai/UnsolvedMath")

הרישיון

המאגר מופץ תחת רישיון CC BY 4.0 שמתיר שימוש מסחרי, שינוי והפצה, כל עוד נותנים ייחוס הולם למפרסמים ומציינים אם בוצעו שינויים. עם זאת, היוצרים מציינים במפורש שמקורות ספציפיים כמו OWR כפופים לרישיונות משלהם דוגמת CC BY-SA 4.0, ולכן אימון מסחרי של מודל דורש בדיקה זהירה של מקור הרשומה לפני השימוש.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗