GPT
G

GSM-Symbolic

קוד פתוח

applecc-by-nc-nd-4.02024-12-08

המאגר מכיל גרסאות סימבוליות לשאלות מתמטיות מבוססות GSM8K כדי לבדוק יכולת הסקה אמיתית של מודלים. הוא נועד למנוע זיהום של נתוני אימון ולחשוף האם מודל מבין מתמטיקה או רק משנן דפוסים קבועים.

  • 5,981הורדות בחודש
  • 24לייקים

מה זה

המאגר מציע שאלות מילוליות במתמטיקה שנוצרו מתוך תבניות המבוססות על מבחן GSM8K המוכר. כל רשומה כוללת את השאלה המקורית והתשובה שלה, לצד השאלה שנוצרה, התשובה התואמת לה ומזהים שונים שמאפשרים לקבץ ולנתח חזרות מרובות של אותה תבנית. כל דוגמה כוללת גם מחרוזת קנרית ייעודית, שנועדה לאתר זליגה של השאלות לתוך נתוני אימון עתידיים של מודלים.

הנתונים מחולקים לשלוש תצורות שונות לפי רמת מורכבות. תצורת הבסיס מציגה שאלות שנבנו ישירות מהתבניות. התצורה השנייה מוסיפה תנאי או פסוקית נוספת לכל שאלה ומעלה את הקושי, והתצורה השלישית מוסיפה שתי פסוקיות נוספות ומאתגרת עוד יותר את יכולת ההסקה. החלוקה הפנימית בכל תצורה מכילה רק קובץ מבחן בפורמט שורות ג'ייסון.

מתאים ל

  • הערכת עמידות של מודלי שפה

    בדיקה אם ביצועי המודל במתמטיקה יציבים גם כאשר משנים שמות, מספרים ומבנים בסיסיים בשאלות מוכרות.

  • מדידת ירידה בדיוק תחת עומס

    השוואת התוצאות בין תצורת הבסיס לתצורות הקשות כדי לראות איך תוספת של תנאים לשאלה פוגעת בהסקה.

  • בקרת זיהום בנתוני אימון

    שימוש במחרוזת הקנרית המובנית כדי לוודא שמבחני הערכה לא נכנסו בטעות לתוך סטים של אימון עתידי.

איפה זה נופל

המאגר כולל פיצול מבחן בלבד ולכן הוא אינו מתאים לאימון ישיר, אלא אך ורק לבדיקה והערכה. הנתונים מוגבלים לשפה האנגלית ומתבססים על שאלות ברמת בית ספר יסודי, כך שהם אינם בוחנים מתמטיקה מתקדמת או הבנה של שפות אחרות. מעבר לכך, אם יש לכם צורך בשינוי התבניות או בהתאמה של השאלות למוצר שלכם, הרישיון אוסר יצירת נגזרות ומגביל את השימוש למחקר בלבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון מכיל סעיף NC שאוסר כל שימוש מסחרי. המאגר מתאים למחקר פנימי או לבדיקות אקדמיות בלבד.

האם יש במאגר תמיכה בשפה העברית?

לא. כל השאלות, ההסברים והתשובות בדאטהסט כתובים באנגלית בלבד. אם תרצו לבחון עברית, הרישיון אף אוסר הפצה של תרגום כי הוא נחשב ליצירה נגזרת.

מה ההבדל בין התצורות השונות במאגר?

המאגר מציע שלוש רמות קושי שמבוססות על אותן בעיות. תצורת main מכילה שאלות ישירות, p1 מוסיפה פסוקית אחת שמעלה את מורכבות החישוב, ו־p2 מוסיפה שתי פסוקיות ומאתגרת עוד יותר את המודל.

למה יש מחרוזת קנרית בכל שורה?

אפל הטמיעה מזהה ייחודי בכל רשומה כדי לזהות זליגה של מבחני ההערכה לתוך נתוני אימון. זה עוזר לגלות אם מודל כלשהו התאמן על המבחן במקום להפגין יכולת חשיבה אמיתית.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון שם התצורה הרצויה, למשל main לבסיס, או p1 ו־p2 לרמות הגבוהות יותר. הגישה פתוחה לחלוטין ואינה דורשת אישור מוקדם או מפתח. המאגר מורכב מקובצי jsonl פשוטים שכוללים שדות מפתח כמו question, answer, instance והשדות המקבילים מהמקור של GSM8K. הפורמט של התשובות שומר על המבנה המוכר עם תווי סולמית לפני התוצאה הסופית, מה שמאפשר שימוש ישיר בפונקציות חילוץ והערכה סטנדרטיות.

from datasets import load_dataset

ds = load_dataset("apple/GSM-Symbolic")

הרישיון

הרישיון הוא CC-BY-NC-ND 4.0. המשמעות היא שאין אישור לשימוש מסחרי, וחובה לתת ייחוס מתאים ליוצרים מאפל. בנוסף, חל איסור מוחלט להפיץ גרסאות מעובדות או יצירות נגזרות של הדאטהסט. לא הייתי מאמן על זה מודל שמיועד למוצר מסחרי, כי הרישיון לא מתיר מסחור ומגביל שינויים בנתונים.

הרישיון המלא ב־Hugging Face ↗