GPT
S

StackMathQA

קוד פתוח

math-aicc-by-4.02024-01-10

  • mathematical-reasoning
  • reasoning
  • finetuning
  • pretraining
  • llm

מאגר של כשני מיליון שאלות ותשובות במתמטיקה מקהילות סטאק אקסצ'יינג', עם נוסחאות מקודדות בלאטך. מתאים למי שמאמן מודלים על פתרון בעיות חישוביות ורוצה חלוקות גודל מוכנות מראש.

  • 1,794הורדות בחודש
  • 104לייקים

מה זה

הנתונים נאספו מארבעה אתרים: Math Stack Exchange, MathOverflow, Cross Validated לסטטיסטיקה, וקהילת הפיזיקה. המאגר מכיל 1,138,426 שאלות ייחודיות וסך של 1,957,006 תשובות. הטקסט כולו באנגלית, והנוסחאות המתמטיות שמורות בסימון LaTeX.

היוצרים ארגנו את המידע בשתי תצורות גולמיות, האחת מקבצת שאלות עם רשימת תשובות תחת A_list, והשנייה מפצלת כל זוג שאלה ותשובה לשורה נפרדת עם השדה A. בנוסף יש תת-קבוצות מסוננות שעברו דגימה מחדש לפי חשיבות, בגדלים של 100 אלף עד 1.6 מיליון רשומות.

בחלוקות המצומצמות יותר יש שליטה כמעט מוחלטת של אתר המתמטיקה הראשי. בגרסת ה־100 אלף, למשל, מעל 99 אלף שורות מגיעות משם, ורק מאות בודדות מגיעות מפיזיקה או מסטטיסטיקה.

מתאים ל

  • אימון מודלים להסבר מתמטי

    כוונון עדין של מודלי שפה על שאלות ותשובות טכניות הכוללות שלבי פתרון ונוסחאות לאטך.

  • אימון מהיר על דאטה קטן

    שימוש בתתי-הקבוצות המוכנות, כמו גרסת 100K, לבדיקת היפותזות בלי לעבד מיליוני שורות מראש.

  • הערכת ביצועים בפתרון בעיות

    בדיקת יכולת המודל לייצר תשובות נכונות לשאלות ברמות קושי שונות מקהילות מדעיות.

איפה זה נופל

המאגר כולו באנגלית בלבד ואין בו שום תמיכה בעברית. אם אתם בונים מודל שאמור לפתור בעיות מנוסחות בעברית, תצטרכו לתרגם אותו בעצמכם או להסתמך על מודל בסיס רב-לשוני חזק. בנוסף, מדובר בתשובות שנכתבו על ידי משתמשי פורומים, כך שאיכות ההסברים והדיוק המתמטי תלויים בסינון הראשוני ולא נבדקו ידנית אחד אחד. בתת-המאגרים הקטנים יש הטיה כמעט מוחלטת לשאלות מתמטיקה כלליות, בעוד שאלות מחקר מ־MathOverflow או שאלות פיזיקה נעלמות כמעט לגמרי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא cc-by-4.0, שמאפשר שימוש מסחרי מלא ללא הגבלה על שיתוף נגזרות. הדרישה היחידה היא לתת קרדיט ליוצרי המאגר.

האם יש במאגר שאלות בעברית?

לא. המאגר מבוסס כולו על אתרי סטאק אקסצ'יינג' באנגלית, וכל השאלות והתשובות מופיעות באנגלית עם סימוני לאטך.

איך נבחרו הרשומות בתת-הקבוצות הקטנות?

היוצרים השתמשו בשיטה של דגימה מחדש לפי חשיבות מתוך המאגר המלא. התוצאה בפועל היא שרוב השאלות בגרסאות הקטנות מגיעות מ־Math Stack Exchange, והייצוג של פיזיקה ו־MathOverflow מצטמצם דרמטית.

מה ההבדל בין שתי התצורות המלאות של המאגר?

תצורת qalist שומרת כל שאלה פעם אחת ומאגדת את כל התשובות שלה ברשימה תחת A_list. תצורת 1q1a מפצלת את הנתונים כך שכל זוג של שאלה ותשובה אחת מופיע כשורה נפרדת.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets בפייתון בעזרת load_dataset, ומעבירים את שם התצורה הרצויה, למשל stackmathqa1600k או הגרסה המלאה stackmathqafull-1q1a. אין צורך באישור גישה או ברישום מיוחד. הקבצים יושבים בפורמט JSONL, והשדות העיקריים שצריך לעבד הם Q עבור השאלה, A או A_list עבור התשובות, ומילון meta שמכיל מידע נוסף על כל רשומה.

from datasets import load_dataset

ds = load_dataset("math-ai/StackMathQA")

הרישיון

המאגר פורסם תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב אתכם לשתף את המודל או את התוצרים שלכם באותו הרישיון. התנאי המרכזי הוא מתן קרדיט וייחוס הולם ליוצרים המקוריים בכל שימוש בנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗