GPT
A

aqua_rat

קוד פתוח

deepmindapache-2.02022-03-02

מאגר בעיות מילוליות באלגברה שכולל פתרונות מוסברים שלב אחר שלב. הוא מיועד למי שרוצה ללמד מודל לנמק מתמטית ולא רק לנחש אות נכונה מתוך רשימה סגורה.

  • 55,974הורדות בחודש
  • 72לייקים

מה זה

המאגר מכיל שאלות מילוליות בחשבון ובאלגברה עם חמש אפשרויות בחירה לכל שאלה. כל רשומה מורכבת מהשאלה עצמה, רשימת האפשרויות, האות שמסמנת את התשובה הנכונה, וטקסט שמפרט את דרך הפתרון החישובית. המטרה של הנתונים האלה היא לאמן מודלים להפיק את שרשרת הנימוק במקביל למציאת התשובה הנכונה.

החלוקה הפנימית כוללת 97,467 דוגמאות אימון, אבל רק 254 דוגמאות בסט הוולידציה ועוד 254 דוגמאות בסט הבדיקה. הכרטיס לא מפרט מה מקור השאלות, מי חיבר אותן או באיזה תהליך הן נאספו וסוננו. יש במאגר שתי גרסאות של הקבצים, אחת גולמית ואחת מפורקת לטוקנים.

מתאים ל

  • אימון שרשרת מחשבה

    אימון מודלי שפה על הסברי פתרון שלב אחר שלב בבעיות אלגבריות.

  • הערכת הנמקה מתמטית

    בדיקת יכולת המודל לייצר הסבר נכון לצד בחירת התשובה המתאימה.

  • למידת יצירת תוכנה וחישוב

    בניית מודלים שמייצרים קוד או פעולות חישוב מתוך טקסט מילולי.

איפה זה נופל

החולשה הבולטת ביותר היא התיעוד. הכרטיס משאיר כמעט כל שדה מהותי ריק, כולל מידע על הטיות, סינון רעשים, או פרטים אישיים. בנוסף, הנתונים באנגלית בלבד, כך שלמי שמחפש לפתור בעיות מילוליות בעברית המאגר לא יעזור בלי תרגום. בעיה נוספת היא גודל הסטים של המבחן והאימות, 254 דוגמאות זה מדגם קטן מאוד שלא בהכרח מייצג את כל מגוון השאלות של האימון. אי אפשר לדעת מתי והיכן נאספו הבעיות, ולכן חייבים לבדוק ידנית את איכות החישובים לפני שמסתמכים עליהם.

שאלות
נפוצות

האם מותר להשתמש בזה במוצר מסחרי?

כן, רישיון Apache 2.0 מתיר שימוש מסחרי חופשי. צריך רק לצרף את תנאי הרישיון המקוריים ואת הודעת זכויות היוצרים של גוגל.

האם הדאטהסט כולל שאלות בעברית?

לא, כל הנתונים במאגר כתובים באנגלית בלבד. אם יש לכם צורך בעברית תצטרכו לתרגם את השאלות וההסברים בעצמכם.

מאיפה הגיעו השאלות האלו?

הכרטיס הרשמי של המאגר לא מספק מידע על המקור או על האנשים שכתבו את השאלות. הוא מציין רק את המאמר המקורי מ־2017 שבו הוצג הדאטהסט לראשונה.

מה שונה בטקסט של השאלות לעומת סתם שאלות מבחן?

ההבדל המרכזי הוא עמודת ה־rationale שמסבירה במילים וחישובים איך מגיעים לתשובה. זה מאפשר ללמד את המודל איך להסביר את החישוב ולא רק לפלוט תשובה סופית.

איך טוענים

טוענים את הנתונים ישירות מספרית datasets דרך מזהה המאגר, בלי צורך באישור גישה או מפתחות. הקבצים יושבים בפורמט Parquet מחולק לרכבות אימון, אימות ובדיקה, כך שהטעינה מהירה. השדות המרכזיים שמעניינים אתכם בקוד הם question, options, correct, ובעיקר rationale שמחזיק את ההסבר הטקסטואלי של הפתרון.

from datasets import load_dataset

ds = load_dataset("deepmind/aqua_rat")

הרישיון

המאגר שוחרר תחת רישיון Apache 2.0 על ידי Google Inc. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ אותו, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. המגבלה הזו לא מחייבת אתכם לשחרר את המודלים שלכם תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗