GPT
M

mmlu

קוד פתוח

caismit2022-03-02

שאלות רב ברירה במגוון נושאים אקדמיים ומקצועיים באנגלית. זהו המבחן המרכזי שכולם בודקים לפיו ידע כללי ויכולות הבנה של מודלים.

  • 732,420הורדות בחודש
  • 830לייקים

מה זה

המאגר מורכב משאלות אמריקאיות עם ארבע אפשרויות תשובה, שמסומנות באותיות A עד D. כל רשומה מכילה את גוף השאלה, הנושא הספציפי שאליו היא שייכת, מערך של ארבע התשובות האפשריות והתשובה הנכונה. התוכן נוצר על ידי מומחים ונאסף מתוך מבחנים אקדמיים ומקצועיים ברמות שונות, החל מנושאי בית ספר בסיסיים ועד רמת קולג' מתקדמת ומקצועות התמחות מורכבים.

המבנה הפנימי מחולק לתצורות לפי מקצועות בודדים, וכולל גם תצורה כללית המאגדת את הכל יחד. בתצורה המלאה יש חלוקה לסט בחינה עם 14042 שאלות, סט אימות עם 1531 שאלות, וסט פיתוח שמכיל 285 שאלות לדוגמה. בנוסף קיים סט אימון עזר ייעודי עם 99842 רשומות, שמיועד למי שרוצה לאמן או לכייל מודלים ולא רק להריץ בדיקות ביצועים.

מתאים ל

  • מבחן השוואה למודל

    מריצים את סט המבחן הכללי כדי לבדוק דיוק מול מודלים אחרים בשוק באנגלית.

  • אימון וידע כללי

    משתמשים בסט העזר שמכיל קרוב למאה אלף דוגמאות לאימון מודל על עובדות.

  • בדיקת תחום ממוקד

    טוענים רק נושא ספציפי כמו רפואה או אבטחת מידע כדי למדוד התמחות.

איפה זה נופל

כל התוכן מנוסח אך ורק באנגלית, וספציפית בניב אמריקאי. אין במאגר שום ייצוג לשפה העברית, לתרבות מקומית או לחוק הישראלי, כך שהוא לא יסייע בהערכת ביצועים מותאמת לארץ. השאלות סגורות לחלוטין במבנה של בחירה מרובה, ולכן המבחן בודק זיהוי של תשובה נכונה ולא יכולת ניסוח עצמאית, ניתוח מעמיק או יצירת קוד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון הוא MIT ולכן הוא מתיר שימוש מסחרי חופשי לחלוטין. התנאי היחיד הוא שמירת הודעת זכויות היוצרים של היוצרים המקוריים בקבצים.

האם יש במאגר שאלות בעברית?

לא. כל השאלות והתשובות מנוסחות באנגלית בלבד, עם מיקוד במונחים ובתכנים מארצות הברית. כדי לבחון מודל בעברית יש צורך במאגרי הערכה מקומיים אחרים.

כמה נפח דורשת הורדת המאגר המלא?

קובצי ההורדה של כלל הנתונים שוקלים סביב 51 מגה בייט בלבד. במצב פרוס על הדיסק כלל הפיצולים תופסים כ 168 מגה בייט, כך שמדובר בנפח קל מאוד לניהול בכל סביבת פיתוח.

מה ההבדל בין סט הבדיקה לסט האימון במאגר?

סט הבדיקה נועד אך ורק להערכת ביצועים ומכיל 14042 שאלות מחולקות לפי מקצועות. לעומתו, סט האימון כולל כמעט מאה אלף דוגמאות שנועדו לכוונון של מודלים לפני המדידה.

איך טוענים

טוענים את המאגר ישירות בעזרת הספרייה של Hugging Face בפורמט Parquet, ללא צורך בהרשמה מוקדמת או באישור גישה מיוחד. אפשר למשוך מקצוע בודד כמו אלגברה או משפטים, או לטעון את התצורה המלאה שכוללת את כל החומר. גודל ההורדה הכולל עומד על כחמישים מגה בייט, כך שהוא נטען במהירות ואינו דורש משאבי אחסון חריגים.

from datasets import load_dataset

ds = load_dataset("cais/mmlu")

הרישיון

המאגר זמין תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לבצע שינויים ולהפיץ אותו מחדש, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. השימוש בו אינו מחייב שיתוף של מודלים שאומנו עליו תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗