GPT
M

tasksource/mmlu

קוד פתוח

tasksourceapache-2.02023-02-01

  • multi-task
  • multitask
  • mmlu
  • hendrycks_test

שאלות רב ברירה במגוון מקצועות אקדמיים ומקצועיים לבחינת מודלי שפה. המאגר משמש תקן מקובל להערכת ידע כללי והסקה באנגלית.

  • 72,763הורדות בחודש
  • 36לייקים

מה זה

הרשומות בנויות כשאלה מרובת ברירות עם ארבע תשובות אפשריות, ומסומנות באות הנכונה מתוך A עד D. המבנה אחיד לגמרי לכל אורך הקבצים ומיועד למשימות סיווג טקסט ומענה על שאלות סגורות.

התוכן מחולק לעשרות קונפיגורציות שונות לפי נושאי לימוד, החל ממתמטיקה יסודית, דרך מדעי המחשב ועד משפטים ורפואה מקצועית. כל תחום כזה מפוצל לשלושה חלקים, כאשר חלק המבחן מכיל בדרך כלל בין מאה לכמה מאות שאלות, חלק האימות קטן מאוד, וחלק הפיתוח כולל רק חמש שאלות בודדות בכל נושא.

הכרטיס לא מפרט מהיכן נאספו השאלות במקור, באילו כלים הן לוקטו או איזה סינון הן עברו לפני האריזה. הנתונים מוגשים באנגלית בלבד ללא הרחבה על תהליך בקרת האיכות.

מתאים ל

  • בנצ'מרק למודלי שפה

    מדידת ביצועים וידע כללי באנגלית בעשרות תחומים שונים.

  • בדיקת הסקה רב ברירתית

    בחינת יכולת המודל לבחור את התשובה הנכונה מתוך ארבע אפשרויות.

  • הערכת few shot

    בדיקת דיוק באמצעות חמש דוגמאות פיתוח בכל תחום ידע.

איפה זה נופל

הנתונים קיימים באנגלית בלבד ואין כאן אף שאלה בעברית או התייחסות לתרבות ולחוק המקומיים. הכרטיס לא מציין מתי המידע נאסף, מה שעלול להשאיר שאלות לא מעודכנות בתחומים דינמיים כמו אבטחת מידע או משפטים. בנוסף, חלוקת הפיתוח כוללת חמש דוגמאות בלבד לכל נושא, מה שמגביל מאוד ניסיונות כוונון ומתאים בעיקר להערכת few shot. לא הייתי מכניס מודל לייצור שמסתמך על הציונים כאן בלי לבדוק התנהגות על שאלות פתוחות מחוץ למבנה האמריקאי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון המדווח הוא apache 2.0 והוא מתיר שימוש מסחרי מלא. אתם נדרשים לשמור על תנאי הייחוס ולא לפגוע בהודעות הרישיון המקוריות. אין חובה לפתוח את הקוד של מודל שאומן על הדאטהסט הזה.

האם יש בדאטהסט שאלות בעברית?

המאגר כולו מוגדר באנגלית בלבד ואין בו שאלות בעברית. הוא לא מתאים להערכת ביצועים לשוניים או ידע מקומי בישראל. אם נדרשת עברית, תצטרכו לתרגם את השאלות או לפנות למאגר אחר.

כמה נפח שוקלים הקבצים בעת ההורדה?

הקבצים שמורים בפורמט parquet דחוס והנפח הכולל קטן מאוד ביחס לדאטהסטים של טקסט. כל תחום שוקל בין עשרות קילובייטים בודדים למגהבייטים ספורים עבור נושאים מורחבים כמו professional law. אפשר להוריד את המאגר במהירות גם בסביבות פיתוח מקומיות עם חיבור רגיל.

מאיפה נאספו הנתונים ואיך הם נבדקו?

כרטיס המאגר בעמוד לא מספק פירוט על מקורות השאלות או שיטות הסינון שננקטו. ידוע רק שהנתונים מאורגנים לפי מקצועות שונים וכוללים שאלות ברמות לימוד מגוונות. מפתחים שזקוקים לתיעוד מקורות מלא יצטרכו לבדוק את הפרסומים המקוריים של מבחן hendrycks שעליו מבוסס הדאטהסט.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות שם המאגר, כאשר אפשר לבחור קונפיגורציה של תחום ספציפי או לטעון נושאים בודדים. אין צורך באישור גישה או במפתח ייעודי, והמאגר פתוח להורדה מיידית. הקבצים מאוחסנים בפורמט parquet קל משקל של עשרות עד מאות קילובייטים לכל נושא, כך שההורדה מהירה מאוד. בכל רשומה חשוב לגשת לשדות question, choices ו־answer כדי לבצע את ההשוואה מול הניבוי של המודל.

from datasets import load_dataset

ds = load_dataset("tasksource/mmlu")

הרישיון

המאגר מופץ תחת רישיון apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון. הוא אינו מחייב שיתוף של תוצרים באותו רישיון, ומודל שאומן או נבדק עליו אינו כבול לחשיפת קוד המקור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗