GPT
G

gsm-hard

קוד פתוח

reasoning-machinesmit2023-01-17

  • math_reasoning
  • symbolic_reasoning

שאלות מתמטיות מילוליות שנוצרו על בסיס GSM8K המוכר, אבל עם מספרים גדולים ונדירים בהרבה. המטרה היא לבדוק יכולת חישוב והסקה שלא נשענת על שינון.

  • 30,558הורדות בחודש
  • 66לייקים

מה זה

מדובר בגרסה מוקשחת של מאגר GSM8K הפופולרי, שפותחה כחלק ממחקר על מודלים שמסתייעים בקוד לפתרון בעיות. הרעיון פשוט: לקחו את שאלות המקור והחליפו את המספרים שמופיעים בהן במספרים גדולים יותר, כאלה שלא מופיעים לעיתים קרובות בטקסטים ברשת. השינוי הזה מאלץ מודלים להתמודד עם אריתמטיקה מורכבת במקום להסתמך על תבניות מספריות מוכרות או על ניחושים סטטיסטיים שהוטמעו במשקלים בזמן האימון.

המבנה כולל חלוקה אחת בלבד של train עם 1319 דוגמאות שנשמרות בקובץ jsonl. כל רשומה מורכבת מטקסט השאלה בשדה input, פתרון בצורת קוד פייתון בשדה code, והתשובה המספרית הסופית בשדה target. הדגש כאן הוא על יצירת קוד שמחשב את התוצאה ולא רק פלט טקסטואלי ישיר, מה שמתאים בעיקר לשיטות הרצה חיצוניות.

מתאים ל

  • הערכת הסקה של מודלים

    בדיקת יכולת המודל לייצר קוד שפותר בעיות חישוב עם מספרים גדולים.

  • בנצ׳מרק לשיטות PAL

    השוואת ביצועים בין מענה טקסטואלי ישיר לבין הרצת קוד חיצונית.

  • בדיקת עמידות מודלים

    מדידה אם המודל נשען על שינון של GSM8K או באמת יודע לפתור בעיות.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים על תרגום מספרי בלבד של בעיות קיימות, בלי שום תמיכה בעברית או בניסוחים מקומיים. מי שמחפש גיוון במבנה הבעיות יתאכזב, כי הניסוח וההיגיון נשארו זהים למקור ורק המספרים הוגדלו. בנוסף, המאגר פורסם בתחילת 2023 ומכיל רק 1319 דוגמאות, כמות קטנה שאינה מתאימה לאימון מודל מאפס אלא בעיקר להערכה נקודתית.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן, רישיון MIT מתיר שימוש מסחרי מלא ללא הגבלות מיוחדות. אפשר לאמן מודלים, להעריך מערכות פנימיות ולשלב את הנתונים בכל תשתית, כל עוד שומרים על תנאי הרישיון המקורי.

במה הוא שונה מ־GSM8K הרגיל?

הטקסט וההיגיון של השאלות נשמרו, אבל המספרים המקוריים הוחלפו במספרים גדולים ולא שגרתיים. בנוסף, הפתרון מגיע כקוד פייתון שמחשב את התוצאה ולא כהסבר מילולי בלבד.

האם יש במאגר תמיכה בעברית?

לא. כל השאלות והפתרונות כתובים באנגלית ובקוד. אם רוצים להשתמש בו להערכה בעברית, תצטרכו לתרגם את השאלות בעצמכם ולוודא שהתרגום לא פוגע במבנה המספרים.

איך טוענים

טוענים את המאגר ישירות בעזרת פקודת load_dataset הרגילה של Hugging Face תחת הנתיב reasoning-machines/gsm-hard. אין צורך לבקש אישור גישה מוקדם או להמתין למפתח. המאגר מכיל רק קובץ נתונים אחד בשם gsmhardv2.jsonl, כך שההורדה שוקלת מעט מאוד ומסתיימת תוך שניות בודדות. השדות שצריך להכיר בסכימה הם input לשאלה המקורית, code לפתרון התכנותי, ו־target לתוצאה שאליה משווים.

from datasets import load_dataset

ds = load_dataset("reasoning-machines/gsm-hard")

הרישיון

המאגר מופץ תחת רישיון MIT, מה שנותן חופש פעולה רחב מאוד. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לשלב אותו במערכות פנימיות ולאמן עליו מודלים חופשיים או סגורים. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים הלאה, בלי חובה לשתף את הקוד או את המודל תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗