GPT
G

gsm8k-platinum

קוד פתוח

madrylabmit2025-03-06

  • math-word-problems

גרסה מתוקנת ומסוננת של סט המבחן המוכר GSM8K למתמטיקה יסודית. היא מסירה שאלות עמומות ומתקנת תוויות שגויות כדי לתת תמונת ביצועים אמיתית.

  • 7,215הורדות בחודש
  • 48לייקים

מה זה

המאגר מבוסס על סט המבחן המקורי של OpenAI, שכלל 1,319 בעיות מילוליות ברמת בית ספר יסודי. החוקרים הריצו שורה של מודלים מובילים על כל הדוגמאות, ובדקו ידנית כל שאלה שלפחות מודל אחד שגה בה. מתוך 219 שאלות שסומנו לבדיקה, 110 שאלות נפסלו לחלוטין בגלל ניסוח לקוי או חוסר בהירות, 10 תוויות תוקנו, ו־99 אומתו כנכונות. התוצאה היא מאגר נקי של 1,209 בעיות.

כל רשומה כוללת את שאלת המקור, פתרון מפורט בשלבים עם חישובי ביניים ותוצאה מספרית סופית, ושדה סטטוס שמעיד על הבדיקה. הסטטוס מפרט אם כל המודלים הסכימו על התשובה מלכתחילה, אם היא נבדקה ואושרה ידנית, או שהתשובה שונתה ועודכנה. אין כאן חלוקה לסט אימון, אלא סט מבחן בלבד שנבנה במבנה תואם למקור.

מתאים ל

  • בנצ'מרק מדויק להסקה

    בדיקת יכולות חישוב ופתרון של מודלים על שאלות נקיות מרעש ותשובות שגויות.

  • החלפה של GSM8K המקורי

    שימוש במבנה הנתונים הקיים כדי להחליף את סט הבדיקה של OpenAI בלי לשנות קוד.

  • ניתוח כשלי מודלים

    מעקב אחרי ביצועים בשאלות שתוקנו מול שאלות שהיה עליהן קונצנזוס מלא.

איפה זה נופל

הנתונים כולם באנגלית בלבד, ואין כאן אף שאלה בעברית או תרגום מובנה. המאגר מיועד אך ורק להערכה של מודלים ולא לאימון, בהיותו סט מבחן קטן של 1,209 דוגמאות בלבד. הרמה מוגבלת למתמטיקה בסיסית של בית ספר יסודי, כך שהוא לא בודק יכולות אלגברה מורכבות או הסקה מדעית מתקדמת. בנוסף, דוגמאות שבהן כל המודלים שנבדקו הגיעו להסכמה לא עברו בדיקה אנושית ידנית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן. המקור תחת רישיון MIT והתוספות של החוקרים מוגנות ברישיון CC BY-SA 4.0. שימוש פנימי לצורכי הערכת מודלים מסחריים מותר, ובלבד שמקפידים על תנאי הייחוס בעת הפצה חיצונית של הנתונים.

כמה המאגר גדול והאם צריך חומרה מיוחדת?

מדובר בסט נתונים זעיר של 1,209 שורות טקסט המאוחסנות בקובץ parquet יחיד. ההורדה והטעינה לוקחות שניות בודדות, וניתן להריץ ולבדוק אותו על כל מחשב פשוט ללא צורך במשאבי חישוב מיוחדים.

האם יש במאגר שאלות בעברית?

לא. כל הטקסטים וההסברים כתובים באנגלית בלבד. אם רוצים לבחון מודל בעברית, תצטרכו לתרגם את השאלות והתשובות באופן עצמאי.

מה ההבדל בינו לבין GSM8K הרגיל?

המאגר המקורי הכיל שאלות מנוסחות רע ותשובות עם תוויות שגויות שהכשילו מודלים שלא בצדק. כאן הוסרו 110 שאלות בעייתיות, תוקנו 10 תוויות מוטעות, ונשארו 1,209 בעיות בדוקות שמתאימות יותר להערכת אמינות.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה הרגילה של Hugging Face עם הפקודה load_dataset, תוך ציון המזהה madrylab/gsm8k-platinum, הקונפיגורציה main, והחלק test. המאגר פתוח לחלוטין לציבור ללא צורך באישור גישה או מפתח מיוחד, והוא שוקל מעט מאוד כי מדובר בקובץ parquet בודד של כאלף ומאתיים שורות. השדות הקריטיים לעבודה הם question, answer והערך של cleaning_status.

from datasets import load_dataset

ds = load_dataset("madrylab/gsm8k-platinum")

הרישיון

המטא-דאטה מציג רישיון MIT שמקורו במאגר הבסיס של OpenAI, אך היוצרים מציינים שהתוספות וההערות שלהם מוגנות תחת רישיון CC BY-SA 4.0. המשמעות היא שמותר להשתמש בנתונים באופן מסחרי, אבל אם משנים את המאגר או מפיצים אותו, חובה לתת קרדיט ולשתף תחת אותו רישיון בדיוק. אימון או בדיקה פנימית של מודל מותרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗