GPT
M

MMMLU

קוד פתוח

openaimit2024-09-13

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

תרגום אנושי מקצועי של מבחן MMLU ל־14 שפות שונות. הוא מאפשר לבדוק ידע כללי ומקצועי של מודלים בשפות שאינן אנגלית, בלי להסתמך על תרגום מכונה צולע.

  • 19,442הורדות בחודש
  • 524לייקים

מה זה

המאגר מבוסס על מבחן MMLU המוכר, שכולל שאלות רב-ברירה ב־57 תחומים שונים, החל מרמת בית ספר יסודי ועד נושאים מקצועיים מתקדמים כמו משפטים, פיזיקה, היסטוריה ומדעי המחשב.

OpenAI לקחו את סט הבדיקה של המבחן המקורי ותרגמו אותו באמצעות מתרגמים אנושיים מקצועיים. המטרה היתה לייצר כלי הערכה אמין יותר, במיוחד עבור שפות עם מעט משאבים ברשת, שבהן תרגום מכונה נוטה לפספס או לייצר שגיאות גסות.

הנתונים מחולקים לפי שפות וניבים ספציפיים. בין השאר תמצאו שם ערבית, בנגלית, גרמנית, ספרדית, צרפתית, הינדי, אינדונזית, איטלקית, יפנית, קוריאנית, פורטוגזית ברזילאית, סוואהילית, יורובה וסינית פשוטה.

מתאים ל

  • הערכת מודלים רב-לשוניים

    בדיקת יכולות ידע כללי של מודל שפה ב־14 שפות שונות מול סט מבחן מתורגם בידי אדם.

  • השוואת ביצועים מול אנגלית

    מדידת הפער בציון המודל בין שאלות המקור באנגלית לבין אותן שאלות בשפות כמו הינדי או יורובה.

  • ולידציה בערבית מקומית

    בחינת יכולות הבנה ומענה על שאלות ידע בערבית עבור מערכות המיועדות לאזור המזרח התיכון.

איפה זה נופל

החיסרון הברור ביותר למי שעובד בישראל הוא היעדר מוחלט של עברית. יש כאן ערבית, אבל אם המטרה שלכם היא להעריך מודל לשוק המקומי בעברית, המאגר לא יעזור לכם. מעבר לכך, מדובר בתרגום ישיר של מבחן אמריקאי במהותו. גם כשהתרגום האנושי מדויק, השאלות עצמן, חוקי המשפט, ההיסטוריה וההקשר התרבותי נשארים מערביים לחלוטין ולא הותאמו למדינות היעד.

שאלות
נפוצות

האם יש במאגר שאלות בעברית?

לא. המאגר כולל 14 שפות בלבד, ביניהן ערבית, יפנית, גרמנית וסוואהילית, אך עברית אינה נכללת בו. אם אתם צריכים לבחון מודל בעברית, תצטרכו לחפש בנצ'מרק אחר.

האם מותר להשתמש במאגר לפרויקטים מסחריים?

כן. הרישיון המוגדר הוא MIT, שמאפשר שימוש חופשי כולל שימוש מסחרי, שכפול והפצה. הדרישה העיקרית היא לכלול את הצהרת הרישיון וזכויות היוצרים המקוריות בעת השימוש.

במה המאגר הזה שונה מ־MMLU הרגיל?

MMLU המקורי נכתב באנגלית בלבד. המאגר הזה לוקח את סט המבחן שלו ומתרגם אותו ל־14 שפות באמצעות מתרגמים אנושיים מקצועיים, במקום להסתמך על תרגום מכונה אוטומטי שלעיתים מעוות שאלות טכניות.

איך טוענים

המאגר פתוח לציבור ואין צורך לבקש אישור גישה מיוחד כדי להוריד אותו. הנתונים שמורים כקובצי CSV פשוטים בתיקיית בדיקה, כאשר כל קובץ מוקדש לשפה או ניב מסוים לפי קוד אזור, כמו test/mmlu_DE-DE.csv או test/mmlu_AR-XY.csv. אפשר לטעון את הקבצים ישירות לתוך פנדס או באמצעות ספריית הדאטהסטים של הגינג פייס. הקוד להרצת ההערכות עצמן זמין במאגר simple-evals של OpenAI בגיטהאב.

from datasets import load_dataset

ds = load_dataset("openai/MMMLU")

הרישיון

המאגר שוחרר תחת רישיון MIT. זה רישיון מתירני שמאפשר שימוש מסחרי, שינוי, הפצה ושילוב במערכות סגורות, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. אין חובה לשתף נתונים נגזרים באותו רישיון, ומבחינה משפטית מותר להעריך מודלים מסחריים על בסיסו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗