GPT
M

mgsm

קוד פתוח

juletxaracc-by-sa-4.02023-05-09

  • math-word-problems

תרגום אנושי של 250 שאלות מתמטיות מתוך GSM8K לעשר שפות נוספות. המאגר בודק יכולות הסקה ושרשרת מחשבה רב לשונית במודלים שונים.

  • 26,392הורדות בחודש
  • 44לייקים

מה זה

המאגר מבוסס על GSM8K, אוסף בעיות מילוליות בחשבון ברמת בית ספר יסודי שדורשות כמה שלבי פתרון. יוצרי המאגר לקחו 250 שאלות בדיקה מקוריות באנגלית ותרגמו אותן בעזרת מתרגמים אנושיים לעשר שפות, ביניהן ספרדית, צרפתית, גרמנית, רוסית, סינית, יפנית, תאילנדית, סוואהילית, בנגלה וטלוגו. שאלות המקור נאספו במקור בעזרת פרילנסרים דרך Upwork ופלטפורמת Surge AI, ועברו בדיקות התאמה ואימות מול פותרים נוספים כדי לסנן בעיות שגויות או לא ברורות.

המבנה מחולק לפי שפות ולשני חלקים נפרדים. חלק הלימוד כולל 8 דוגמאות בלבד לכל שפה, שמיועדות לשמש כדוגמאות לפרומפטים עם הסבר שלבי הפתרון והמשוואה המלאה. חלק המבחן כולל את 250 השאלות המתורגמות, אך שם מסופק רק המספר הסופי של התשובה ללא שלבי הפתרון המפורטים.

מתאים ל

  • הערכת שרשרת מחשבה רב לשונית

    בדיקת יכולת המודל להציג פתרון מתמטי שלבי בשפות כמו ספרדית, יפנית או רוסית.

  • בנצ'מרק השוואתי למודלים

    מדידת הדיוק הסופי של תשובות מתמטיות מול 250 שאלות המבחן בכל שפה נתמכת.

  • בניית פרומפטים מסוג Few-shot

    הזנת 8 הדוגמאות המפורטות מחלק הלימוד כהקשר כדי לשפר פתרון בעיות בשפות שונות.

איפה זה נופל

זה לא מאגר לאימון. עם 8 דוגמאות בחלק הלימוד ו־250 במבחן לכל שפה, אי אפשר לאמן פה מודל מאפס, והוא נועד להערכה בלבד או לפרומפטים ספורים. עברית לא קיימת כאן, כך שלבדיקת יכולות חישוב בעברית המאגר לא יעזור בלי תרגום עצמאי. מעבר לזה, המקור מודה שכ־1.7 אחוזים מהשאלות ב־GSM8K המקורי עדיין הכילו שגיאות או ניסוחים מעורפלים בבדיקות ההסכמה, וייתכן שתרגום אנושי הכניס אי דיוקים נוספים לשפות היעד.

שאלות
נפוצות

האם המאגר מתאים לבדיקת מודלים בעברית?

לא, עברית לא נכללת בעשר השפות שתורגמו. המאגר מכיל אנגלית, ספרדית, צרפתית, גרמנית, רוסית, סינית, יפנית, תאילנדית, סוואהילית, בנגלה וטלוגו בלבד. כדי להשתמש בו עבור מודלים בעברית, תצטרכו לתרגם את השאלות באופן עצמאי.

האם אפשר להשתמש במאגר לפיתוח מסחרי?

הרישיון המדווח הוא CC-BY-SA 4.0, שמאפשר שימוש מסחרי אך מחייב מתן קרדיט ושיתוף נגזרות תחת אותו רישיון. אם תפיצו גרסה מעובדת של הנתונים, תצטרכו להשאיר אותה פתוחה באותו אופן. מומלץ לבדוק את ההשלכות המשפטיות על תוצרי אימון לפני שילובו במוצר.

כמה שאלות יש בסך הכל והאם זה מתאים לאימון מודל?

יש בכל שפה 8 דוגמאות בלבד בחלק הלימוד ו־250 שאלות בחלק המבחן. בגלל הגודל המזערי, אי אפשר לאמן פה מודלים בצורה משמעותית. המאגר מיועד להערכת ביצועים או לשילוב כדוגמאות בודדות בתוך פרומפט.

במה הוא שונה מ־GSM8K המקורי?

המאגר המקורי כולל כ־8,500 שאלות ופתרונות באנגלית בלבד. הפרויקט הזה לקח מדגם ספציפי של 250 שאלות מתוכו ותרגם אותו לשפות שונות בעזרת מתרגמים אנושיים. מטרת ההרחבה היא לבדוק כיצד יכולת ההסקה המתמטית של מודל נשמרת במעבר בין שפות שונות.

איך טוענים

הנתונים מחולקים לפי תיקיות של קודי שפות ונשמרים כקובצי Parquet, לצד קובצי tsv מקוריים. אין צורך באישור גישה מיוחד, וטוענים את החלק הרצוי ישירות לפי השפה המבוקשת. גודל הקבצים קטן מאוד בגלל מספר הדוגמאות המצומצם, כך שההורדה מיידית. בשדה question נמצא הטקסט של הבעיה המילולית, ובחלק המבחן השדה העיקרי לבדיקה הוא answer_number, שמכיל את הערך המספרי הסופי להשוואה מול הפלט של המודל.

from datasets import load_dataset

ds = load_dataset("juletxara/mgsm")

הרישיון

המאגר מוגדר ברישיון CC-BY-SA 4.0, שמתיר שימוש מסחרי ועריכה אך דורש מתן קרדיט ושיתוף של נגזרות תחת אותו רישיון בדיוק. המאגר המקורי GSM8K פורסם ברישיון MIT, אך הגרסה הזו מחמירה יותר. אם אתם משתמשים בנתונים כדי ליצור מאגרים חדשים, תצטרכו לשחרר אותם באותו רישיון שיתוף זהה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗