GPT
M

lighteval/mmlu

קוד פתוח

lightevalmit2023-05-16

שאלות רב ברירה במגוון מקצועות אקדמיים ומקצועיים לבחינת ידע כללי של מודלי שפה. המאגר מציע מבנה אחיד וחלוקה לקטגוריות שמאפשרים לבדוק מודלים מול בנצ'מרק סטנדרטי בלי צורך בעיבוד מוקדם ומסובך.

  • 17,350הורדות בחודש
  • 43לייקים

מה זה

הרשומות בנויות כבחינה אמריקאית סטנדרטית עם ארבע אפשרויות בחירה. כל שורה מכילה שאלה בטקסט חופשי, תחום ידע ספציפי, מערך של ארבע תשובות אפשריות ותשובה נכונה אחת שמסומנת באותיות מאלף ועד דלת בלטינית. השאלות נכתבו על ידי מומחים בתחומם ולא עברו עיבוד על ידי מתייגים חיצוניים, מה ששומר על רמה מקצועית ומנוסחת היטב.

המבנה מחולק לעשרות קונפיגורציות לפי נושאים, החל ממתמטיקה מופשטת ועד אתיקה עסקית, לצד תצורת על שמרכזת את כלל התחומים. בכל קונפיגורציה קיימת חלוקה לארבעה חלקים עיקריים. יש סט אימון עזר רחב מאוד שכולל כמעט מאה אלף דוגמאות, סט מבחן של עשרות עד מאות שאלות לנושא, וסטים קטנים יותר של ולידציה ופיתוח שנועדו לכיוונון ובדיקות מהירות.

מתאים ל

  • הערכת ביצועי מודל שפה

    בדיקת הדיוק של מודלים מול עשרות תחומי ידע שונים בצורה השוואתית ותקנית.

  • אימון נוסף למשימות ידע

    שימוש בסט האימון הרחב כדי ללמד מודלים להתמודד עם שאלות רב ברירה מקצועיות.

  • סינון מודלים לפי תחום

    בחינת יכולות ספציפיות בנושאים בודדים כמו רפואה, מתמטיקה או אבטחת מידע.

איפה זה נופל

החומר כולו כתוב באנגלית אמריקאית בלבד ואין בו שום תוכן בעברית או ייצוג לשפות אחרות. השאלות משקפות ידע שנאסף ממבחנים ומערכי לימוד אקדמיים, מה שאומר שהן בודקות בעיקר שינון עובדות והיגיון פורמלי ולא שיחה שוטפת או הבנת הקשר מורכב. לא כדאי להסתמך על זה לבדיקת יכולות כלליות במוצר שמיועד לקהל ישראלי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא אם איי טי מלא ולכן אין מניעה להשתמש בנתונים לפיתוח מוצרים מסחריים. כל מה שנדרש הוא לכלול את הצהרת הרישיון המקורית של היוצרים.

כמה מקום המאגר תופס בהורדה?

ההורדה של התצורה המלאה שוקלת כחמישים ואחד מגה בייט בלבד. גם בפריסה מלאה בזיכרון מדובר בכמאה ושבעים מגה בייט, כך שזה רץ בקלות על כל מחשב פיתוח רגיל.

האם יש בדאטהסט שאלות בעברית?

לא, כל השאלות והתשובות במאגר מנוסחות באנגלית בלבד. אם אתם בונים כלי ייעודי לשוק המקומי, תצטרכו לתרגם את השאלות או לחפש מקור מקומי אחר.

מאיפה הגיעו השאלות ומי יצר אותן?

השאלות נוצרו על ידי מומחים בתחומם ומבוססות על מבחנים מקצועיים ואקדמיים ברמות שונות. לא נעשה כאן שימוש בתיוג המונים, ולכן הניסוחים מדויקים ומותאמים לרמה אוניברסיטאית.

איך טוענים

המאגר יושב בפורמט פרקט וכולל 234 קבצים שמחולקים לפי תיקיות נושא. אפשר למשוך אותו ישירות דרך הספרייה בלי צורך בהרשמה מיוחדת, טופס גישה או אישור ידני מהיוצרים. נפח ההורדה של תצורת העל עומד על כחמישים מגה בייט, כך שהמשקל קל ואינו דורש תשתית אחסון ייעודית.

בטעינה אתם מקבלים ישירות את השדות שאלה, תחום, תשובות ותווית נכונה. שימו לב שהשדה של התשובה הנכונה מקודד כמספר שממפה לאות, כך שצריך לחלץ את הערך המתאים מתוך המערך של האפשרויות בזמן הריצה.

from datasets import load_dataset

ds = load_dataset("lighteval/mmlu")

הרישיון

המאגר מופץ תחת רישיון מסחרי פתוח מסוג אם איי טי. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הנתונים, שילוב במערכות סגורות והפצה מחדש, כל עוד שומרים על הודעת זכויות היוצרים המקורית. אין כאן חובת שיתוף תחת אותו רישיון, ומודל שאומן או הוערך על בסיס הנתונים האלה אינו כבול במגבלות קוד פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗