GPT
M

lukaemon/mmlu

קוד פתוח

lukaemonרישיון לא דווח2023-02-02

שאלות רב ברירה אקדמיות ומקצועיות בחלוקה לנושאים מוגדרים. המאגר משמש לבדיקת ידע כללי ויכולת פתרון בעיות של מודלי שפה.

  • 3,604הורדות בחודש
  • 62לייקים

מה זה

הנתונים מורכבים משאלות מבחן אמריקאיות עם ארבע אפשרויות בחירה ותשובה נכונה אחת. כל רשומה כוללת את גוף השאלה בשדה הקלט, ארבע אפשרויות שונות המסומנות באותיות, ואת התשובה הנכונה בשדה היעד. המבנה הזה אחיד לכל אורך הקונפיגורציות.

המאגר מחולק לעשרות נושאים נפרדים, ביניהם אלגברה, אסטרונומיה, רפואה, פילוסופיה, משפטים והיסטוריה. בכל נושא כזה יש חלוקה פנימית למבחן, אימות ואימון, כאשר חלק האימון מכיל באופן קבוע חמש דוגמאות בלבד. כרטיס המאגר אינו מפרט מהיכן השאלות נאספו במקור או אילו סינונים בוצעו עליהן לפני הפרסום.

מתאים ל

  • הערכת ידע כללי במודלים

    מדידת ביצועים של מודלי שפה על שאלות רב ברירה במגוון נושאים אקדמיים ומקצועיים.

  • בדיקת יכולת מענה עם דוגמאות

    הרצת מבחנים במצב של דוגמאות ספורות בעזרת חמש הדוגמאות המוכנות מראש בכל נושא.

  • השוואה בין תחומי ידע שונים

    בדיקה של פערי ביצועים במודל בין נושאים מדעיים, שאלות הומניות ונושאי משפט ורפואה.

איפה זה נופל

חלק האימון כולל רק חמש דוגמאות לכל קטגוריה, כך שאי אפשר לאמן עליו מודלים בצורה מסורתית והוא מתאים בעיקר להערכה במצב של דוגמאות בודדות. הטקסט כולו באנגלית, ואין פה ייצוג לשפות אחרות או התאמה כלשהי לישראל. כרטיס המאגר לא מדווח על מקור השאלות, גיל הנתונים או הטיות קיימות, ולכן אי אפשר לדעת אילו תשובות התיישנו מאז הפרסום בתחילת שנת 2023. לפני שמשלבים בדיקה כזו במערכת, צריך לוודא שהפורמט מתאים בדיוק לצורת התשובה של המודל שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ לעשות את זה כרגע. היוצר לא ציין שום רישיון, מה שאומר שמבחינה חוקית זכויות היוצרים שמורות ואין הרשאה ברורה לפעילות מסחרית. שימוש כזה עלול לחשוף את הפרויקט לסיכונים משפטיים.

כמה שוקל הדאטהסט ואיך מתמודדים עם המשקל?

נפח ההורדה המלא הוא קצת מעל מאה שישים ושישה מגה בייט. זה משקל קל מאוד שלא דורש חומרה מיוחדת או שטחי אחסון יקרים. אפשר לטעון קטגוריות בודדות לפי הצורך במקום למשוך את הכל בבת אחת.

האם יש שאלות בעברית?

אין במאגר עברית בכלל. כל השאלות והתשובות מופיעות באנגלית ונוגעות לנושאים כלליים, אקדמיים או מערביים. מי שצריך לבדוק יכולות בעברית יצטרך לתרגם את הנתונים בעצמו או לחפש חלופה מקומית.

מה ההבדל בין חלקי האימון והמבחן?

חלוקת הנתונים לא מיועדת לאימון מלא של מודל. חלק האימון בכל תחום מכיל בדיוק חמש דוגמאות שנועדו להדגמה קצרה בפרומפט, בזמן שעיקר הדוגמאות מרוכזות במבחן ובאימות. המטרה היא להעריך את המודל ולא לבנות אותו מחדש.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה הרגילה באמצעות קריאה לתצורת הנושא הספציפית שרוצים, כמו אלגברה או משפטים. אין צורך באישור גישה מיוחד, וההורדה זמינה מיד. גודל ההורדה הכולל עומד על כמעט מאה שישים ושבעה מגה בייט. השדות הקריטיים לעבודה הם שדה השאלה, ארבעת שדות האפשרויות, ושדה התשובה שמכיל את האות הנכונה. הקוד שמפעיל את הטעינה נשען על קובץ סקריפט ייעודי שמצורף למאגר.

from datasets import load_dataset

ds = load_dataset("lukaemon/mmlu")

הרישיון

היוצר לא דיווח על רישיון שימוש במאגר. מצב כזה אומר שאין לכם היתר מפורש להשתמש בנתונים למטרות מסחריות, לשנות אותם או להפיץ אותם מחדש. שימוש במאגר ללא רישיון מוגדר חושף אתכם לסיכון משפטי, במיוחד אם אתם בונים מוצר מסחרי או מאמנים מודל שיופץ ללקוחות.

הרישיון המלא ב־Hugging Face ↗