GPT
G

GSM-Plus

קוד פתוח

qintonglicc-by-sa-4.02024-07-04

מאגר שאלות מילוליות בחשבון שנועד לבדוק אם מודל באמת מבין מתמטיקה או רק זוכר בעל פה. הוא לוקח בעיות מוכרות ומערער אותן בכוונה כדי לחשוף נקודות שבירה.

  • 5,337הורדות בחודש
  • 18לייקים

מה זה

הבסיס כאן הוא 1,319 שאלות המבחן המקוריות של GSM8K. החוקרים לקחו כל שאלה כזו וייצרו ממנה שמונה וריאציות שונות, כך שבסך הכל המאגר כולל 10,552 שאלות מילוליות ברמת בית ספר יסודי.

השינויים נשענים על חמישה כיוונים שונים לפי עקרונות פוליה. הם כוללים שינויי מספרים והחלפת שלמים בשברים, היפוך או הוספה של פעולות חשבון, ניסוח מחדש של הטקסט, הזרקת משפטים מסיחים שלא תורמים לפתרון, ובדיקה של חשיבה ביקורתית במצבים שבהם חסר נתון בשאלה. כל רשומה כוללת את השאלה המקורית מול השאלה החדשה, סוג השינוי, דרך הפתרון והתשובה הסופית.

במאגר יש שני פיצולים עיקריים ששמורים כקובצי jsonl, אחד הוא סט המבחן המלא והשני הוא גרסה מוקטנת לבדיקות מהירות.

מתאים ל

  • מבחן עמידות למודלים

    בדיקת ביצועי מודל שפה על שאלות מתמטיות מול וריאציות שמנסות לבלבל אותו בכוונה.

  • איתור דליפות מאימון

    בדיקה אם המודל רק שינן את GSM8K המקורי או מסוגל להתמודד עם שינוי נתונים וניסוחים.

  • מדידת עמידות למסיחים

    הערכת היכולת של המודל לסנן נתונים לא רלוונטיים שנשתלו בתוך השאלה המילולית.

איפה זה נופל

המאגר כולו כתוב באנגלית בלבד, כך שהוא לא יעזור ישירות למי שבוחן יכולות בעברית בלי לתרגם אותו קודם. נקודה קריטית נוספת היא שחלק מהשאלות בקטגוריית החשיבה הביקורתית הוגדרו ללא נתונים מספיקים במכוון, ולכן לא לכל שורה יש פתרון מספרי רגיל. אם הסקריפט שלכם מצפה לתשובה מספרית פשוטה בכל ריצה, הוא ייכשל שם.

שאלות
נפוצות

האם מותר לאמן מודל על הדאטהסט הזה?

לא, היוצרים אוסרים על כך במפורש בכרטיס המאגר. הוא מיועד אך ורק כסט מבחן להערכת ביצועים. מותר להשתמש בו מסחרית, אבל רק ככלי בדיקה.

האם יש במאגר שאלות בעברית?

לא, כל 10,552 השאלות מופיעות באנגלית בלבד. אם רוצים לבחון מודל בעברית, תצטרכו לתרגם את השאלות ואת שרשראות הפתרון באופן עצמאי. קחו בחשבון שתרגום עלול לפגוע בחלק מהמניפולציות המילוליות.

איך יצרו את השאלות החדשות?

החוקרים לקחו 1,319 שאלות מסט המבחן של GSM8K ופיתחו שמונה וריאציות שונות לכל שאלה. השינויים מתחלקים לחמש קטגוריות, בהן החלפת ערכים, שינוי פעולות חשבון, והוספת משפטים מסיחים.

מה ההבדל בינו לבין GSM8K הרגיל?

ב־GSM8K המקורי יש שאלות סטנדרטיות שמודלים רבים כבר ראו באימון שלהם. המאגר הזה מכיל מניפולציות מכוונות שמטרתן לבדוק חוסן ולראות אם המודל נופל כשמשנים לו פרט קטן או כשמוסיפים מידע מיותר.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה של Hugging Face עם הפקודה load_dataset על הנתיב qintongli/GSM-Plus. המאגר פתוח לגמרי, בלי צורך בבקשת גישה או אישור מיוחד. הנתונים מגיעים בקובצי jsonl וקובץ json מרכזי. שדות המפתח שצריך לשים לב אליהם בריצה הם question שמחזיק את הווריאציה החדשה, solution שמציג את שרשרת הפתרון המלאה, answer עם התשובה המספרית, ו־perturbation_type שמגדיר בדיוק איזה סוג מניפולציה נעשה ביחס לשאלת המקור.

from datasets import load_dataset

ds = load_dataset("qintongli/GSM-Plus")

הרישיון

החומרים החדשים מופצים תחת רישיון cc-by-sa-4.0, שדורש מתן קרדיט ושיתוף באותם תנאים. היוצרים הוסיפו סייג מפורש בעמוד המאגר: השימוש מותר לצורכי בדיקה והערכה בלבד, כולל שימוש מסחרי לבדיקות. חל איסור מוחלט לאמן מודלים על הנתונים האלה, כך שאי אפשר להכניס אותם ל־fine-tuning.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗