GPT
C

competition_math

קוד פתוח

qwedsacfmit2023-01-28

  • explanation-generation

פתרון בעיות מתמטיות מתחרויות עם שלבי הסבר מפורטים בפורמט לאטך. המאגר מציע תרגילים ברמות קושי שונות לאימון והערכה של הסקת מסקנות כמותית במודלי שפה.

  • 21,588הורדות בחודש
  • 138לייקים

מה זה

המאגר מבוסס על בעיות מתמטיות מורכבות שנלקחו מתחרויות מוכרות כמו AMC 10, AMC 12 ו־AIME. כל רשומה כוללת את נוסח השאלה המלא, את הפתרון המפורט שלב אחר שלב בשפה טבעית ונוסחאות לאטך, וכן את התשובה הסופית כשהיא תחומה בתגית מוגדרת. בנוסף, כל פריט מקוטלג לפי נושא ורמת קושי שנקבעה מראש.

התוכן מחולק לשבעה תחומים מתמטיים מוגדרים היטב: אלגברה, אלגברה תיכונית, גיאומטריה, תורת המספרים, קדם-אלגברה, קדם-חשבון אינפיניטסימלי, וקומבינטוריקה והסתברות. רמות הקושי מדורגות מחמש רמות, מדרגה אחת למשימות הבסיסיות ביותר ועד דרגה חמש לשאלות הקשות ביותר לבני אדם. כרטיס המאגר לא מפרט תהליכי סינון או עיבוד מיוחדים שנעשו מעבר לאיסוף הבעיות המקוריות מהתחרויות.

מתאים ל

  • אימון מודלים לפתרון בעיות

    לימוד מודלי שפה לייצר דרכי פתרון מתמטיות שלב אחר שלב ולא רק לנחש את התשובה הסופית.

  • מבחן ביצועים להסקה לוגית

    בדיקת יכולת ההסקה הכמותית של מודלים מול בעיות תחרותיות ברמות קושי שונות.

  • חילוץ אוטומטי של תשובות

    בניית כלים שמעריכים פתרונות מתמטיים על ידי השוואת התשובה הסופית מתוך תגיות הלאטך.

איפה זה נופל

הטקסט כולו כתוב באנגלית ורווי נוסחאות לאטך כבדות, מה שמקשה על מי שמפתח יישומים בשפות אחרות בלי תרגום והתאמה של מבנה השאלות. הכרטיס אינו מספק מידע על מגבלות, הטיות באוכלוסיית הבוחנים או שיטות הבקרה שנעשו בעת איסוף הפתרונות. בנוסף, הנתונים מתבססים על תחרויות שנערכו עד סביבות שנת 2021, כך שהם אינם כוללים ניסוחים ומבחנים עדכניים יותר.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצרים מסחריים?

כן, הרישיון המוגדר הוא MIT, שמתיר שימוש מסחרי ללא מגבלות על קוד סגור או מכירת המודל. עליכם רק לצרף את הודעת הרישיון המקורית. הדבר מאפשר לאמן מודלים שיוטמעו במוצרים עסקיים.

האם המאגר כולל תמיכה בעברית?

לא, כל השאלות והפתרונות כתובים באנגלית בלבד. אם אתם מכוונים לקהל ישראלי או לממשק מקומי, תצטרכו לתרגם את השאלות ולשמור על תקינות תחביר הלאטך. תרגום כזה דורש בקרת איכות על המונחים המקצועיים.

מאיזה מקורות נאספו הבעיות?

התרגילים מגיעים ישירות ממבחנים ותחרויות מתמטיקה מוכרות בארצות הברית, בהן AMC 10, AMC 12 ו־AIME. החומר מייצג רמת קושי גבוהה של תלמידי תיכון מתקדמים. המקורות מכסים מגוון תחומים מאלגברה ועד קומבינטוריקה.

איך מחלצים את התשובה הנכונה לבדיקה אוטומטית?

התשובה הסופית בכל רשומה מופיעה בתוך מחרוזת הפתרון כשהיא סגורה בתוך תגית ייעודית של לאטך. ניתן להשתמש בביטוי רגולרי פשוט כדי לשלוף את הערך הסופי מתוך הטקסט. מבנה זה מאפשר לכתוב קוד הערכה שמשווה את פלט המודל מול ערך המטרה.

איך טוענים

אתם יכולים לטעון את הנתונים ישירות מספריית המאגרים בלי צורך באישור גישה או הרשמה מוקדמת. המידע מסודר בקובץ פרקט בודד לחלוקת האימון, והטעינה מתבצעת בכמה שניות.

בעבודה עם הנתונים חשוב להכיר את מבנה השדות. השדות המשמעותיים הם שאלת הבעיה, מחרוזת הפתרון המלאה, רמת הקושי והתחום המתמטי. התשובה הסופית תמיד מוטמעת בתוך פקודת תיבה ייעודית בלאטך, כך שניתן לחלץ אותה ישירות לצורך בדיקת דיוק אוטומטית של המודל.

from datasets import load_dataset

ds = load_dataset("qwedsacf/competition_math")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי, שינוי, הפצה ושילוב במודלים ובתוכנות, ללא דרישה להפיץ יצירות נגזרות תחת אותו הרישיון. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה. שימוש בנתונים לאימון מודלים מסחריים מותר באופן מלא לפי תנאים אלה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗