GPT
M

math_qa

קוד פתוח

allenaiapache-2.02022-03-02

מאגר שאלות מילוליות במתמטיקה מרובות ברירה עם שרשרת הסבר ונוסחאות מובנות. הוא מיועד למי שמפתח מודלים לפתרון בעיות כמותיות ולא רוצה להסתפק רק בניחוש של התשובה הנכונה.

  • 29,875הורדות בחודש
  • 121לייקים

מה זה

המאגר מבוסס על שאלות שנלקחו מפרויקט AQuA-RAT, ומכיל בעיות מילוליות במתמטיקה לצד אפשרויות בחירה, נימוק מילולי, והתשובה הנכונה. החוקרים הוסיפו על גבי הנתונים המקוריים שפת ייצוג חדשה של תוכניות פעולה מוגדרות, כך שכל רשומה כוללת גם נוסחה מילולית ישירה וגם נוסחה לינארית שמציגה את שלבי החישוב בצורה פורמלית ומדויקת.

כל שורה כוללת את השדות Problem, Rationale, options, correct, annotated_formula, linear_formula וכן קטגוריה כמו general. מבנה זה מאפשר לבחון לא רק אם המודל הגיע לאות הנכונה, אלא אם הוא הבין את רצף הפעולות הנדרש. הנתונים מחולקים לשלושה חלקים מוכנים מראש: אימון עם 29,837 דוגמאות, ולידציה עם 4,475 דוגמאות, ומבחן עם 2,985 דוגמאות. בכרטיס לא מצוין תהליך סינון מעבר להרחבת הדוגמאות מתוך מאגר המקור.

מתאים ל

  • אימון מודלים לפתרון בעיות

    לימוד מודל לפרק שאלה מילולית לשלבים ולחזות נוסחת פתרון מלאה במקום רק לבחור תשובה.

  • הערכת יכולות הסקה כמותית

    בדיקת הדיוק של מודלים קיימים על סט המבחן שמכיל כמעט 3,000 שאלות עם שלבי נימוק.

  • מחקר על ייצוגי תוכנה

    בחינת מעבר מטקסט חופשי לרצף פעולות מוגדר בעזרת הנוסחאות הלינאריות שמצורפות לכל שאלה.

איפה זה נופל

הנתונים קיימים באנגלית בלבד ואין בהם מילה אחת בעברית, כך שלא תוכלו להשתמש בהם ישירות למודלים מקומיים בלי תרגום משמעותי. הבעיות בנויות כרובן במבנה של מבחנים רב-ברירתיים, פורמט שלא מייצג קלט טבעי בעולם האמיתי ומאפשר למודלים לנחש או לזהות דפוסים שטחיים. בנוסף, הכרטיס אינו מספק מידע על הטיות, אופן בחירת השאלות המקוריות או מגבלות דמוגרפיות, כך שחובה לבדוק ידנית את איכות הנוסחאות לפני שילובן במערכת מבצעית.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. כל הבעיות המילוליות, הנימוקים והאפשרויות כתובים באנגלית בלבד. אם יש צורך בהערכה בעברית, תידרשו לתרגם את השאלות תוך שמירה זהירה על המשתנים שבנוסחאות.

מותר להשתמש בו במוצר מסחרי?

כן, רישיון apache-2.0 מתיר שימוש מסחרי מלא באימון ובהרצת מודלים. נדרש רק לכלול את עותק הרישיון המקורי ולתת ייחוס ליוצרים.

כמה מקום נדרש כדי להוריד אותו?

ההורדה שוקלת 7.30 מגה בייט בלבד. על הדיסק המאגר המעובד תופס 22.96 מגה בייט, ובסך הכל כ־30 מגה בייט כולל קבצים נלווים.

במה הוא שונה מ־AQuA-RAT המקורי?

השאלות והתשובות נלקחו מ־AQuA-RAT, אבל כאן נוסף ייצוג פורמלי ייחודי. החוקרים הוסיפו נוסחאות מוגדרות ונוסחאות לינאריות לכל שאלה כדי לאפשר פתרון באמצעות צעדים חישוביים ברורים.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות המזהה allenai/math_qa. המאגר ציבורי ואינו דורש הרשמה מוקדמת או אישור גישה מיוחד. נפח הקבצים להורדה עומד על 7.30 מגה בייט, ובפריסה מלאה על הדיסק הוא תופס 22.96 מגה בייט, כך שמדובר בנתונים קלים מאוד לעיבוד שלא דורשים זיכרון חריג. בזמן העבודה כדאי לשים לב בעיקר לשדות annotated_formula ו־linear_formula, שהם הערך המוסף האמיתי כאן לעומת שאלות אמריקאיות רגילות.

from datasets import load_dataset

ds = load_dataset("allenai/math_qa")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש חופשי כולל שימוש מסחרי, שינוי של הנתונים והפצה מחודשת שלהם. מותר גם לאמן מודלים על בסיס הנתונים ללא חובת פתיחת הקוד או שיתוף המודל באותו רישיון. התנאי העיקרי הוא מתן קרדיט ברור ושמירה על הודעות זכויות היוצרים של הפרויקט המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗