GPT
C

Calc-ape210k

קוד פתוח

MU-NLPCmit2023-05-22

המאגר מכיל בעיות חשבון מילוליות מפורקות לצעדי חישוב עם תגיות להפעלת מחשבון חיצוני. הוא מיועד למי שמאמן מודל שפה לפתור תרגילים בלי לטעות בפעולות אריתמטיות פשוטות.

  • 3,034הורדות בחודש
  • 27לייקים

מה זה

הנתונים מבוססים על Ape210K, מאגר שאלות מתמטיות במקור מסינית. החוקרים תרגמו את השאלות לאנגלית באמצעות Google Translate, חילצו את המשוואות והפכו אותן לשרשרת צעדים ליניארית בפורמט דמוי HTML. הפורמט משתמש בשלוש תגיות מוגדרות: gadget לקריאה למחשבון חיצוני מבוסס sympy, תגית output לתוצאה של אותו חישוב, ו־result לתשובה הסופית המספרית.

כל צעד עבר אימות מול מחשבון סימבולי, וכל דוגמה שבה הפלט לא תאם את התוצאה המקורית נמחקה מהמאגר, מחיקה שהסתכמה בפחות משלושה אחוזים בכל חלוקה. בנוסף בוצע סינון של זליגות נתונים פנימיות ורוחביות בתוך אוסף Calc-X. בחלוקת ברירת המחדל נותרו כ־1,700 דוגמאות בסט הוולידציה וכ־1,700 בסט המבחן. מי שמעוניין בגרסה המקורית ללא הסינון יכול לטעון את תצורת original-splits.

מתאים ל

  • אימון מודל לשימוש במחשבון

    לימוד מודלי שפה לזהות מתי לעצור את הטקסט, לשלוח פקודה למחשבון חיצוני, ולהמשיך בפתרון לפי התוצאה.

  • אימון שרשראות חשיבה

    יצירת צעדי פתרון מובנים לבעיות מילוליות בחשבון עם חלוקה מדויקת של שלבי העבודה.

  • בדיקת יכולות הסקת מסקנות

    בחינת מודלים על סטים מסוננים של בעיות מילוליות כדי למדוד דיוק בלי תלות בשגיאות חישוב טכניות.

איפה זה נופל

התרגום לאנגלית נעשה כולו במכונה דרך Google Translate, ללא עריכה אנושית ידנית. זה אומר שיש בטקסט שגיאות תרגום וניסוחים עקומים שיכולים להשפיע על איכות האימון. עברית לא קיימת כאן כלל, רק אנגלית ותרגום המקור מסינית.

בנוסף, המאגר מותאם אך ורק למודלים שקוראים לכלי חיצוני מבוסס sympy. אם אתם בונים מודל שאמור לחשב הכל בעצמו ללא כלים או שמשתמש במנוע חישוב שונה, הפורמט של שדה השרשרת לא יתאים למשימה בלי עיבוד נוסף.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. המאגר פורסם תחת רישיון MIT שמאפשר שימוש מסחרי מלא ללא תשלום. הדרישה היחידה היא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוצר.

האם יש במאגר נתונים בעברית?

לא. השאלות כוללות טקסט באנגלית שתורגם אוטומטית, לצד הטקסט המקורי בסינית בלבד. אם רוצים להשתמש בו לאימון מודל בעברית, צריך לתרגם את השאלות עצמאית.

איך המאגר הזה שונה מ־Ape210K המקורי?

השאלות תורגמו מסינית לאנגלית, המשוואות עברו פירוק לצעדים ליניאריים עם תגיות ייעודיות לכלי חישוב, ונמחקו דוגמאות שגויות. בנוסף, בוצע סינון זליגות נתונים שהקטין את סטי הבדיקה והוולידציה.

מה המשמעות של התגיות בטקסט הפתרון?

הטקסט כולל תגיות HTML פשוטות: gadget עוטף את הביטוי שנשלח למחשבון sympy, output מקבל את התוצאה שחזרה ממנו, ו־result מכיל את התשובה הסופית. מבנה זה מאפשר לפרסר לקרוא את שלבי החישוב בקלות.

איך טוענים

טוענים את הנתונים ישירות דרך פונקציית load_dataset של ספריית datasets עם המזהה MU-NLPC/calc-ape210k. המאגר פתוח לציבור ואינו דורש אישור גישה מראש. הקבצים שמורים בפורמט parquet ומחולקים לסטים של אימון, בדיקה ואימות.

השדות החשובים לעבודה הם chain שמכיל את שרשרת הפתרון עם התגיות הייעודיות, question שמכיל את השאלה באנגלית, ו־result ששומר את התשובה הסופית. זמינים גם שדות המשוואה המקורית, התוצאה במספר עשרוני, והטקסט המקורי בסינית.

from datasets import load_dataset

ds = load_dataset("MU-NLPC/Calc-ape210k")

הרישיון

המאגר מופץ תחת רישיון MIT, תואם לרישיון של המקור. הרישיון מתיר שימוש מסחרי, מחקרי, שינוי והפצה, ללא דרישה להפיץ עבודות נגזרות תחת אותו רישיון. נדרש רק לתת קרדיט ולצרף את הודעת הרישיון המקורית, ואין מגבלה על שימוש במודלים שאומנו על הנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗