GPT
M

mmlu-redux

קוד פתוח

edinburgh-dawgcc-by-4.02024-06-04

המאגר מכיל 3,000 שאלות מתוך מבחן MMLU המוכר, שעברו בדיקה ותיוג ידני מחדש. המטרה היא לחשוף שגיאות בניסוח ובתשובות המקוריות כדי לאפשר הערכה אמינה ומדויקת יותר של מודלים.

  • 4,175הורדות בחודש
  • 38לייקים

מה זה

המאגר כולל דגימה של 100 שאלות מתוך 30 נושאים שונים שנלקחו מהמבחן המקורי של cais/mmlu. מתוך שלושים הנושאים, עשרים נבחרו על בסיס ביצועים חלשים במיוחד של מודלים מובילים בלוח התוצאות של HELM, כמו מתמטיקה אקדמית, פיזיקה, רפואה ומשפטים, ועשרה נושאים נוספים נדגמו באקראי, בהם היסטוריה, פילוסופיה ואסטרונומיה. כל שאלה הוצלבה מול מקורות מידע מהימנים כדי לבדוק האם התשובה המקורית שסומנה כנכונה אכן עומדת במבחן המציאות.

כל שורה במאגר מכילה שבע עמודות קבועות. לצד השאלה, ארבע האפשרויות והתשובה מהמקור, מופיעים סיווג סוג השגיאה, המקור האפשרי ברשת, הצעת המתייגים לתשובה הנכונה והסבר חופשי לסיבת התקלה. הסיווגים חולקו לשני צירים עיקריים: בעיות בהירות בניסוח השאלה או האפשרויות, ושגיאות מהותיות בתשובה, כגון חוסר בתשובה נכונה, מספר תשובות אפשריות, או תשובה מקורית שגויה לחלוטין.

מתאים ל

  • סינון שאלות שגויות בבדיקה

    ניקוי שאילתות מטעות או שגויות מתוך מבחן הביצועים כדי למדוד את יכולת המודל האמיתית.

  • ניתוח כשלים של מודלים

    הצלבת טעויות הניבוי של המודל מול עמודת סוג השגיאה כדי לבדוק האם הוא נפל בגלל פגם בדאטה.

  • הערכה עם תשובות מתוקנות

    הרצת בדיקות על הנושאים הנבחרים באמצעות התשובות הנכונות שהציעו המתייגים במקום המקור.

איפה זה נופל

הנתונים כולם באנגלית בלבד ואין כאן התאמה לשפות אחרות או הקשר ישראלי. שאלות עם ניסוח לקוי לא שוכתבו אלא נשארו כפי שהיו במקור, כך שהן עדיין עלולות להכשיל מודל. בנוסף, מדובר רק ב־30 נושאים מתוך 57 הנושאים שיש בבנצ'מרק המלא, ורק 100 שאלות נבדקו מכל תחום, כך שהכיסוי חלקי ולא נותן תמונה שלמה על כלל המבחן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן. הרישיון הוא cc-by-4.0, והוא מאפשר שימוש מסחרי מלא ללא הגבלת רווח. התנאי היחיד הוא מתן קרדיט מתאים ליוצרי המאגר המקוריים.

האם יש במאגר תוכן בעברית?

לא. כל 3,000 השאלות והתשובות במאגר מנוסחות באנגלית בלבד. מי שמחפש לבדוק ביצועים בעברית יצטרך לתרגם את הנתונים או להשתמש במקור אחר.

מה ההבדל בין מאגר זה ל־MMLU המקורי?

הטקסט של השאלות והאפשרויות נשאר זהה למקור, אך נוספו תיוגים של בודקים אנושיים שחיפשו מקורות מהימנים לכל שאלה. בזכות זה נוספו עמודות המצביעות על שאלות ללא תשובה נכונה, טעויות בסימון התשובה המקורית, ואי בהירות בניסוח.

האם המאגר מכסה את כל הנושאים של המבחן המלא?

לא. המאגר כולל רק 30 נושאים מתוך 57 הנושאים של MMLU, כאשר 20 מתוכם נבחרו ספציפית כי מודלים התקשו בהם במיוחד. בדף הפרויקט מומלץ לעבור לגרסה 2.0 אם יש צורך בכל הנושאים.

איך טוענים

המאגר פתוח לגישה ישירה בפורמטים סטנדרטיים כמו קבצי Arrow וטבלאות CSV, המחולקים לפי תיקיות הנושאים השונים. אין צורך בבקשת אישור או בהרשמה מיוחדת כדי למשוך את הנתונים. בעבודה שוטפת צריך לשים לב בעיקר לעמודת סוג השגיאה, שכן המאגר כולל גם שאלות תקינות וגם שאלות שגויות, ולעמודת התשובה המתוקנת כדי לדרוס את התיוג המקורי במידת הצורך.

from datasets import load_dataset

ds = load_dataset("edinburgh-dawg/mmlu-redux")

הרישיון

הנתונים מפורסמים תחת רישיון cc-by-4.0. הרישיון מתיר שימוש חופשי, כולל שימוש מסחרי, שינוי והפצה, בתנאי שניתן ייחוס הולם ליוצרים המקוריים ומצוין אם נעשו שינויים. הרישיון אינו דורש שיתוף תחת אותו רישיון, ומודל שאומן או הוערך בעזרת הנתונים אינו מחויב להיפתח לציבור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗