GPT
M

math_dataset

קוד פתוח

deepmindרישיון לא דווח2022-03-02

המאגר מייצר צמדים של שאלות ותשובות במתמטיקה ברמת בית ספר לבדיקת יכולות חשיבה אלגברית. הוא מתאים למי שרוצה לאמן או לבחון מודלים על פתרון בעיות סינתטיות מוגדרות היטב.

  • 12,913הורדות בחודש
  • 139לייקים

מה זה

הנתונים בנויים משני שדות טקסט בלבד, question ו־answer, שמכילים את השאלה המתמטית ואת התשובה הישירה אליה. המאגר מבוסס על קוד שמייצר את השאלות באופן סינתטי מתוך מגוון סוגי בעיות אלגבריות, כולל משוואות ליניאריות במשתנה אחד או שניים, גרסאות מורכבות שלהן, ומציאת שורשים של פולינומים. המידע לא נאסף מבני אדם אלא חושב ומפולש לפי תבניות מוגדרות מראש.

החלוקה הפנימית מפרידה את התוכן לתתי נושאים מוגדרים. בכל תת נושא שמוצג בכרטיס, כמו אלגברה ליניארית או פולינומים, יש בדיוק 1,999,998 דוגמאות באימון ו־10,000 דוגמאות בבדיקה.

מתאים ל

  • בחינת יכולת אלגברית

    בדיקת הדיוק של מודלי שפה בפתרון משוואות ליניאריות וחישוב שורשי פולינומים.

  • אימון על בעיות מורכבות

    אימון מודלים על שאלות מתמטיות רב שלביות שמיוצרות באופן סינתטי מובנה.

  • בנצ׳מרק למחקר תאורטי

    השוואת ביצועים בין ארכיטקטורות שונות על נתונים סינתטיים מבוקרי קושי.

איפה זה נופל

הנתונים מוגבלים לאנגלית בלבד ואין בהם מילה אחת בעברית. שאלות שנוצרו בקוד נוטות להיות סטריליות ותבניתיות, כך שהן לא משקפות ניסוחים טבעיים ומבולגנים של בני אדם, ומי שבונה על זה מודל לעולם האמיתי יקבל תוצאות מנותקות. בנוסף, כרטיס המאגר משאיר כמעט את כל סעיפי התיעוד ריקים לגבי הטיות, תהליך הסינון ומגבלות ידועות, כך שאין שום מידע רשמי על כשלים ספציפיים שהיוצרים גילו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כרטיס המאגר לא מציין שום רישיון. המשמעות היא שאין הרשאה ברורה להשתמש בנתונים למטרות מסחריות, ויש סיכון משפטי באימון מודל שיימכר ללקוחות. יש לבדוק את הרישיון שמופיע במאגר הגיטהאב של הפרויקט המקורי לפני השימוש.

כמה נפח אחסון צריך לפנות עבורו?

הורדת כלל הקבצים לוקחת 130.65 ג׳יגה בייט, והנתונים המעובדים דורשים עוד 9.08 ג׳יגה בייט. בסך הכל המאגר המלא תופס 139.73 ג׳יגה בייט על הדיסק. אם טוענים רק תת קבוצה אחת, הנפח קטן בהרבה ועומד על כ־2.5 ג׳יגה בייט לחלק.

האם יש במאגר תמיכה בעברית?

לא, המאגר מוגדר לשפה האנגלית בלבד. כל השאלות והתשובות מנוסחות באנגלית ובתחביר מתמטי מערבי. כדי לבדוק מודלים בעברית תצטרכו לתרגם את השאלות בעצמכם.

מאיפה הנתונים האלה הגיעו?

הנתונים לא נאספו ממבחנים אמיתיים או מאתרים ברשת. הם נוצרו באמצעות קוד של חוקרי דיפמיינד שמייצר בעיות מתמטיות ותשובות באופן אלגוריתמי לפי רמות קושי של בית ספר.

איך טוענים

טוענים תת קבוצה ספציפית בעזרת ספריית datasets לפי הנתיב של הנושא הרצוי, למשל תרגול כפל או אלגברה. לפני שמורידים צריך לפנות מקום רציני בדיסק, כי הורדת כלל הקבצים דורשת 130.65 ג׳יגה בייט, והדאטהסט המופק תופס עוד 9.08 ג׳יגה בייט, סך הכל 139.73 ג׳יגה בייט לכל החבילה. אין צורך באישור גישה כדי להוריד, והקוד מספק ישירות את שדות הטקסט של השאלה והתשובה.

from datasets import load_dataset

ds = load_dataset("deepmind/math_dataset")

הרישיון

הרישיון של המאגר לא דווח בכרטיס. במצב כזה אין אישור שימוש מסחרי מפורש, ואי אפשר לדעת אם מותר לשלב את הנתונים במוצר מסחרי או מה התנאים לגבי הפצת מודל שאומן עליהם. לשימוש שאינו מחקרי פנימי, מומלץ לבדוק את הרישיון במאגר המקורי בגיטהאב לפני שנוגעים בקבצים.

הרישיון המלא ב־Hugging Face ↗