GPT
M

mmlu_no_train

קוד פתוח

hailsmit2023-10-31

גרסה של מבחן הידע MMLU שמיועדת להערכה בלבד וללא סט אימון נוסף. היא מכילה שאלות רב-ברירה במגוון נושאים לבדיקת ביצועי מודלים.

  • 65,512הורדות בחודש
  • 29לייקים

מה זה

המאגר מארגן שאלות מבחן אמריקאי באנגלית לפי נושאים שונים באקדמיה ובמקצועות שונים. כל רשומה כוללת את נוסח השאלה, הנושא שאליו היא שייכת, מערך של ארבע אפשרויות בחירה ומזהה של התשובה הנכונה מתוכן. המאגר מציע קונפיגורציות לפי נושאים ספציפיים לצד קונפיגורציה כוללת שמאגדת את כל החומר.

החלוקה הפנימית בכל נושא כוללת שלושה חלקים בלבד, והם חלק בדיקה, חלק ולידציה וחלק פיתוח. המפרסם בנה את המאגר הזה ללא סט אימון עזר, כך שהוא משמש נטו להרצת מדידות ופיתוח מול דוגמאות קבועות מראש. מקורות איסוף השאלות המקוריים או שיטות הסינון המדויקות אינם מפורטים בכרטיס הנתונים.

מתאים ל

  • הערכת מודלי שפה

    בדיקת רמת הידע הכללי והמקצועי של מודל באמצעות שאלות רב-ברירה באנגלית.

  • מדידת ביצועים לפי נושא

    הרצת בדיקות ממוקדות בתחומים מוגדרים כמו רפואה, מתמטיקה או מדעי המחשב.

  • בקרת איכות בהרצה

    שימוש בחלקי הוולידציה והפיתוח לכוונון פרומפטים או בדיקות מהירות.

איפה זה נופל

המאגר קיים בשפה האנגלית בלבד, כך שהוא לא מתאים כלל לבדיקת ביצועים או ידע בעברית. אין בכרטיס שום פירוט על תאריכי עדכון התוכן, הטיות אפשריות בשאלות או אופן הרכבתן. בנוסף, חסר כאן סט אימון, כך שמי שמחפש דאטה כדי לאמן עליו מודל מאפס לא יקבל מענה מהחבילה הזו.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

כן, הרישיון המדווח הוא MIT שמתיר שימוש מסחרי חופשי. עליכם רק לצרף את תנאי הרישיון והודעת זכויות היוצרים בעת ההפצה.

האם יש במאגר שאלות בעברית?

לא, המאגר מוגדר לשפה האנגלית בלבד. כל השאלות, הנושאים והתשובות מנוסחים באנגלית.

מה ההבדל בין מאגר זה לגרסאות MMLU אחרות?

במאגר זה הוסר סט האימון הנוסף במכוון. המטרה היא לספק כלי טעינה קל שמתמקד אך ורק בחלקי הבדיקה, הוולידציה והפיתוח לצורך הערכה.

איך טוענים

טוענים את המאגר ישירות בספריית הדאטהסטים באמצעות המזהה שלו, ללא צורך באישור גישה מיוחד. הקבצים מאוחסנים בפורמט פרקט לפי תיקיות נושאים, כאשר בקונפיגורציה הכוללת גודל ההורדה עומד על 3987384 בתים ונפח הדאטהסט הוא 7856290 בתים. השדות החשובים לשימוש הם הטקסט של השאלה, רשימת המסיחים והתשובה הנכונה שמסומנת כאות.

from datasets import load_dataset

ds = load_dataset("hails/mmlu_no_train")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ודורש שמירה על הודעת זכויות היוצרים ומלל הרישיון המקורי. הוא אינו כופה שיתוף באותו רישיון ואינו מטיל מגבלות קנייניות על מודלים שנבדקים או מאומנים מולו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗