GPT
M

MMLU-Pro

קוד פתוח

TIGER-Labmit2024-05-08

  • evaluation

אפשר גם להריץ אותו בדפדפן בלי להתקין דבר.

מאגר מבחן מתקדם להערכת מודלי שפה, שמחליף את הניחוש העיוור של ארבע אפשרויות בעשר תשובות ומאלץ את המודל להפגין יכולת חשיבה מעמיקה ולא רק שינון.

  • 235,333הורדות בחודש
  • 512לייקים

מה זה

המאגר כולל 12,032 שאלות אמריקאיות קשות במגוון דיסציפלינות כמו מתמטיקה, פיזיקה, כימיה, משפטים והנדסה. רוב השאלות מציגות עשר אפשרויות בחירה במקום ארבע, כדי לצמצם הצלחה מניחוש מקרי ולהקשות על מענה ישיר ללא שרשרת מחשבה.

הבסיס מורכב מסינון של שאלות מקוריות מתוך מאגר הבנצ'מרק המוכר, לצד 5,222 שאלות חדשות שנאספו ממקורות כמו אתרי מדע וטכנולוגיה, מבחני אוניברסיטה ממאגר SciBench, ושאלות מבוססות משפטים מתוך TheoremQA. כדי להרחיב את מספר המסיחים השתמשו ביוצרי תוכן אוטומטיים מבוססי מודלים, ולאחר מכן צוות מומחים עבר ידנית על הנתונים, תיקן טעויות והסיר מסיחים לא הגיוניים.

מתאים ל

  • הערכת יכולות הסקה

    בדיקת ביצועי מודלי שפה במשימות הדורשות חשיבה רב-שלבית מורכבת במדעים מדויקים.

  • השוואת ביצועי מודלים

    מדידת פערים אמיתיים בין גרסאות מודלים שונות מול עשרה מסיחים מבלבלים במקום ארבעה.

  • בקרת איכות לתשובות שגויות

    ניתוח מקרים שבהם מודל נוטה ליפול למסיחים מנומקים שנוצרו על ידי בינה מלאכותית.

איפה זה נופל

כל השאלות והתשובות מנוסחות באנגלית בלבד, כך שהמאגר אינו בודק יכולות בעברית או בהקשרים מקומיים. בנוסף, המפרסמים עצמם מדווחים על טעויות עובדתיות ומבניות שמתגלות ומתוקנות לאורך הזמן, החל מרווחים מיותרים באפשרויות ששימשו מודלים כקיצור דרך, ועד תיקוני תוכן ברפואה, מתמטיקה וניסוחי שאלות. אל תסתמכו על תקינות עיוורת בכל שאלה בודדת.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

כן, הרישיון המוגדר הוא MIT, שמתיר שימוש מסחרי חופשי, שינוי והפצה ללא דרישה לשיתוף תחת אותו רישיון. כל מה שנדרש הוא שמירה על הצהרת זכויות היוצרים המקורית.

האם המאגר כולל תוכן בעברית?

לא. המאגר מוגדר וכתוב כולו בשפה האנגלית, ומתמקד בנושאים אקדמיים ומקצועיים בינלאומיים ללא התאמה לשפות אחרות.

מה ההבדל העיקרי מול הדאטהסט המקורי?

בגרסה הזו הוסיפו מסיחים כך שברוב השאלות יש עשר אפשרויות בחירה במקום ארבע, מה שמוריד דרמטית את הסיכוי לנחש נכון. בנוסף, השאלות עברו התאמה שמעודדת פתרון באמצעות שרשרת מחשבה ומפחיתה את התלות בשינון בלבד.

איך נאספו השאלות והאפשרויות הנוספות?

השאלות הגיעו מסינון המאגר המקורי, ממאגרי שאלות אקדמיים כמו SciBench ו־TheoremQA, ומאתרי מדע באינטרנט. המסיחים הנוספים נוצרו באמצעות GPT-4 ונבדקו על ידי צוות מומחים כדי להבטיח את איכותם.

איך טוענים

הנתונים מחולקים לקובצי Parquet מוכנים עבור שלבי האימות והמבחן, ללא צורך בהרשאות מיוחדות או אישור גישה מוקדם. המאגר כולל גם סקריפטים להרצה ישירה של הערכות מול מודלים, וקובץ הגדרות בפורמט YAML. מומלץ להריץ את המודלים שלכם עם הנחיה שמחייבת שרשרת מחשבה, משום שבמענה ישיר הציונים צונחים בחדות.

from datasets import load_dataset

ds = load_dataset("TIGER-Lab/MMLU-Pro")

הרישיון

המאגר מופץ תחת רישיון MIT. מותר להשתמש בו בחופשיות לכל צורך, כולל מחקר ושימושים מסחריים, וניתן להעריך או לאמן עליו מודלים מסחריים בלי חובת שיתוף זהה, כל עוד שומרים על הודעת זכויות היוצרים של היוצרים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗