GPT
M

mmlu-redux-2.0

קוד פתוח

edinburgh-dawgcc-by-4.02024-08-17

שאלות רב-ברירה באנגלית לבדיקת ידע כללי ומקצועי עם פירוט שגיאות ותיקונים. המאגר מאפשר להעריך מודלים על בנצ'מרק מתוקן ומדויק יותר מהמקור.

  • 41,914הורדות בחודש
  • 38לייקים

מה זה

המאגר מכיל שאלות רב-ברירה שנלקחו מבנצ'מרק MMLU ומחולקות לתחומי ידע שונים. כל רשומה כוללת את נוסח השאלה, רשימת אפשרויות בחירה, התשובה שנחשבה נכונה ומזהה מספרי שלה, לצד מקור השאלה. הערך המרכזי כאן הוא התוספת של שדות המצביעים על שגיאות במקור: סוג השגיאה, התשובה הנכונה בפועל, והסבר לסיבה האפשרית לטעות.

המבנה הפנימי מחולק לתצורות רבות לפי נושאי לימוד ספציפיים, כמו אלגברה מופשטת, אסטרונומיה, רפואה, פילוסופיה, לוגיקה וכלכלה ברמות שונות. בכל תצורה כזו מוגדר רק חלק בדיקה אחד שמכיל 100 דוגמאות. התיעוד לא מפרט כיצד נאספו הנתונים במקור או לפי אילו קריטריונים מדויקים סוננו השגיאות, אך השדות המובנים מספקים שכבת ביקורת ידנית או חצי-אוטומטית על גבי המבחנים הקיימים.

מתאים ל

  • הערכת מודלי שפה

    בדיקת דיוק המודל מול שאלות ידע מתוקנות כדי למנוע ירידה בציון בגלל תשובות שגויות במקור.

  • ניתוח כשלי בנצ'מרקים

    חקר סוגי השגיאות הנפוצים במבחני ידע קיימים באמצעות שדות סיווג הטעויות.

  • אימות תשובות מודל

    השוואת הפלט של מודל נבדק לתשובה המתוקנת לעומת התשובה המקורית שנחשדה כשגויה.

איפה זה נופל

הנתונים קיימים באנגלית בלבד ואין כאן שום ייצוג לעברית. בנוסף, מדובר במאגר הערכה בלבד שאינו כולל חלוקה לאימון, וגודל הדגימות מוגבל ל־100 שאלות בכל קטגוריה. הכרטיס לא מציין מתי בדיוק נאספו השאלות או מי בדק אותן בפועל, ולכן לפני שמסתמכים על תיקוני התשובות בבדיקות אוטומטיות כדאי לדגום את שדה הסיבה הפוטנציאלית ולוודא שהתיקון אכן מדויק.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא ללא תשלום. התנאי היחיד הוא מתן קרדיט ברור למפרסמי המאגר בכל הפצה או הצגה שלו. אימון או בדיקה של מוצר מסחרי על הנתונים אינם מגבילים את רישוי המוצר עצמו.

האם יש במאגר שאלות בעברית?

לא, כל השאלות והתשובות במאגר מוגדרות וכתובות בשפה האנגלית בלבד. אם המוצר שלכם מיועד לשוק המקומי בישראל, תצטרכו לתרגם את השאלות או להתאים אותן עצמאית.

במה המאגר הזה שונה מ־MMLU המקורי?

בניגוד למקור שבו ידוע שישנן שגיאות בתיוג התשובות הנכונות, המאגר הזה כולל שדות ייעודיים לזיהוי שגיאות, הסבר לטעות ותיקון התשובה. המבנה מאפשר להריץ הערכה נקייה יותר בלי להיענש על כשלים בבנצ'מרק עצמו.

מה הגודל הכולל של הנתונים?

המאגר מכיל בין אלף לעשרת אלפים רשומות בסך הכל, ומחולק לעשרות קטגוריות שונות שכל אחת מהן כוללת 100 שאלות בדיקה. הנתונים שמורים בקובצי arrow קלים וההורדה שלהם מהירה מאוד.

איך טוענים

הנתונים שמורים בקובצי arrow ומאורגנים לפי תצורות שונות עבור כל תחום בנפרד. אפשר לטעון ישירות דרך ספריית datasets על ידי ציון שם התצורה המבוקשת. אין צורך בבקשת אישור גישה מוקדמת. בעבודה מול הרשומות תצטרכו להסתכל בעיקר על שדות השאלה, האפשרויות, והשדות correct_answer ו־error_type כדי להבין אם הדוגמה תוקנה או שיש בה פגם מוכר.

from datasets import load_dataset

ds = load_dataset("edinburgh-dawg/mmlu-redux-2.0")

הרישיון

הרישיון הוא cc-by-4.0. המשמעות היא שמותר להשתמש בדאטהסט לצרכים פנימיים, מחקריים ומסחריים, ואין חובה לשתף נגזרות באותו רישיון. החובה היחידה היא לתת קרדיט הולם ליוצרים המקוריים של המאגר. שימוש בו להערכה או לאימון מודל אינו מחייב את שחרור משקולות המודל ברישיון פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗