GPT
G

gsm8k

קוד פתוח

openaimit2022-04-12

  • math-word-problems

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

זהו מאגר של 8,500 בעיות מילוליות בחשבון ברמת בית ספר יסודי עם פתרונות מפורטים. הוא נבנה במיוחד כדי לבחון יכולות חשיבה רב שלביות במודלי שפה.

  • 1,246,266הורדות בחודש
  • 1,600לייקים

מה זה

המאגר כולל 8,500 שאלות מילוליות שדורשות בין שניים לשמונה שלבי חישוב אריתמטיים בסיסיים, ללא אלגברה מתקדמת. כל רשומה כוללת את השאלה ואת הפתרון המלא בשפה טבעית, יחד עם תיוגים של חישובי ביניים והתשובה הסופית. יש כאן שתי תצורות: הראשית, והסוקרטית שמוסיפה תת-שאלות מנחות לכל שלב בדרך לפתרון.

האיסוף התחיל במיקור חוץ לפרילנסרים דרך Upwork, והורחב באמצעות חברת Surge AI. כדי לסנן רעשים, פרילנסרים אחרים פתרו מחדש כל בעיה. מקרים עם חוסר הסכמה נמחקו או תוקנו, ובבדיקה חוזרת נמצאו אי הסכמות ב־1.7% מהשאלות, שיעור השגיאות המוערך בחומר. החלוקה קבועה: 7,473 דוגמאות לאימון ו־1,319 לבדיקה.

מתאים ל

  • בנצ'מרק להסקה רב שלבית

    מדידת הדיוק של מודלי שפה בפתרון בעיות חישוב הדורשות כמה שלבים.

  • אימון שרשרת מחשבה

    כוונון עדין של מודלים להפקת פתרונות מלאים ומנומקים בשפה טבעית.

  • אימון מודלים סוקרטיים

    שימוש בתצורת socratic לפירוק שאלות מורכבות לתת-שאלות פשוטות.

איפה זה נופל

הנתונים כולם באנגלית בלבד, ואין כאן ייצוג לעברית או לתרבויות שאינן מערביות. יוצרי המאגר עצמם מודים בכ־1.7% בעיות שמכילות שגיאות מהותיות או ניסוחים מעורפלים, וייתכן שיש שיעור גבוה יותר של טעויות עדינות יותר. בנוסף, מדובר ברמת קושי בסיסית מאוד של חשבון ללא אלגברה מורכבת, ולכן הוא לא מתאים להערכת יכולות מתמטיות גבוהות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון MIT מתיר שימוש מסחרי מלא, כולל אימון מודלים למוצרים סגורים. התנאי היחיד הוא שמירה על הצהרת הרישיון המקורית של הקבצים.

האם יש במאגר שאלות בעברית?

לא. כל השאלות והתשובות נכתבו באנגלית בלבד. אם המטרה היא בדיקה בעברית, תצטרכו לתרגם את הנתונים באופן עצמאי.

איך נאספו השאלות?

השאלות נכתבו על ידי עובדים חיצוניים בפלטפורמות Upwork ו־Surge AI. לאחר מכן, בודקים נוספים פתרו את השאלות מחדש כדי לאמת את התוצאות ולסנן טעויות.

כמה שוקל הדאטהסט הזה?

המאגר קטן מאוד ומכיל 8.5 אלף רשומות בלבד בשבעה קבצי Parquet. ההורדה והטעינה שלו לוקחות שניות בודדות בכל סביבת עבודה.

איך טוענים

טוענים את הנתונים ישירות דרך Hugging Face ללא צורך באישור גישה. הקבצים יושבים בפורמט Parquet קל משקל, ומחולקים לשתי הקונפיגורציות: main ו־socratic. המבנה שטוח לגמרי ומכיל שני שדות טקסט בלבד, question ו־answer, כך שאין צורך בעיבוד מקדים מורכב מלבד חילוץ התשובה הסופית המסומנת אחרי סולמיות.

from datasets import load_dataset

ds = load_dataset("openai/gsm8k")

הרישיון

הרישיון הוא MIT, מה שאומר שיש חופש מלא לעשות בנתונים שימוש מסחרי ומחקרי, לשנות אותם ולאמן עליהם מודלים. הדרישה היחידה היא לכלול את הודעת זכויות היוצרים והרישיון המקוריים בהפצה של הקוד או הנתונים עצמם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗