GPT
K

KMMLU

קוד פתוח

HAERAE-HUBcc-by-nd-4.02023-11-27

  • mmlu
  • haerae

שאלות רב ברירה ברמת מומחה ב־45 תחומים שונים, שנאספו ישירות ממבחנים מקוריים בקוריאה. הוא מיועד לבדיקת מודלי שפה על ידע מקצועי ותרבותי בלי להסתמך על תרגום מאנגלית.

  • 12,561הורדות בחודש
  • 101לייקים

מה זה

המאגר מכיל שאלות אמריקאיות מקוריות בקוריאנית ממבחנים רשמיים, ולא תרגומים של מבחנים מערביים כמו MMLU המקורי. השאלות מכסות 45 נושאים נפרדים, החל ממדעי הרוח ועד תחומי מדע, הנדסה, חשבונאות וחקלאות, ומחולקות לפי דרישות ידע מקדימות כמו שנות ניסיון או מעבר של מבחנים קודמים.

מבחינת מבנה, הדאטה מחולק לקובצי CSV נפרדים לפי מקצועות ולפי חלוקה קלאסית של אימון, ולידציה ובדיקה. יש פה 208,522 שאלות באימון, 225 בוולידציה, ועוד 35,030 שאלות ייעודיות בסט הבדיקה. רוב מוחלט של השאלות מנוסחות בצורה חיובית, אבל יש גם עשרות אלפי שאלות על דרך השלילה.

מתאים ל

  • הערכת מודלים בקוריאנית

    בדיקת יכולות הבנת שפה וידע כללי ומקצועי של מודלי שפה בקוריאנית מול בנצ'מרק תקני.

  • אינטגרציה ל־LM Harness

    הרצת מבחני השוואה אוטומטיים בין מודלים שונים בעזרת התמיכה המובנית של EleutherAI.

  • בדיקת ידע מקצועי ספציפי

    בחינת יכולות המודל במקצועות מוגדרים מתוך 45 הקטגוריות, כמו חשבונאות, חקלאות או מתמטיקה.

איפה זה נופל

החומר כולו בקוריאנית בלבד. אם המוצר שלכם לא פונה לשוק הקוריאני, אין לכם מה לחפש כאן, ועברית בוודאי שאין פה. מדובר במבחן קשה מאוד שמודלים חזקים כמו GPT-4 ו־HyperCLOVA X קיבלו בו פחות מ־60 אחוז דיוק, נמוך מהממוצע האנושי של 62.6 אחוז שעליו דיווחו החוקרים. בנוסף, מדובר במבחני ידע תיאורטיים ומקצועיים, כך שזה לא מתאים להערכת שיחה חופשית או יצירתיות.

שאלות
נפוצות

האם המאגר כולל עברית או תרגום לאנגלית?

לא. המאגר נבנה כולו בקוריאנית ומבוסס על בחינות אותנטיות שנכתבו במקור בשפה הזו, בלי תרגומים לשפות אחרות.

האם מותר להשתמש בו לאימון מודל מסחרי?

הרישיון הוא cc-by-nd-4.0, שמתיר שימוש מסחרי אך אוסר הפצה של תוצרים נגזרים. בשל האיסור על יצירות נגזרות, גופים מסחריים רבים נמנעים מאימון ישיר של מודלים על דאטהסטים כאלה ומגבילים את השימוש לבדיקות והערכה בלבד.

במה הוא שונה מגרסאות מתורגמות של MMLU?

בנצ'מרקים קודמים בקוריאנית תורגמו ממבחנים אמריקאיים, מה שגרם לעיוותים לשוניים ולחוסר התאמה תרבותית. כאן הנתונים לוקטו ישירות ממבחני הסמכה ומבחנים מקצועיים מקוריים בקוריאה.

איך מריצים הערכה עם הדאטה הזה?

השאלות מחולקות לקובצי CSV פשוטים לפי מקצוע, וניתן לטעון אותם עצמאית בקוד. בנוסף, המאגר כבר מחובר ישירות ל־LM Evaluation Harness של EleutherAI, כך שניתן להריץ הערכה מוכנה מראש.

איך טוענים

טוענים את הקבצים ישירות מהמאגר, אין צורך בבקשת גישה מיוחדת או באישור ידני. הנתונים מאורגנים ב־138 קבצים, רובם קובצי CSV שמחולקים לפי נושא וסוג הפיצול, למשל Accounting-train.csv או math-dev-checkpoint.csv. השילוב שלו מובנה גם בתוך ספריית הבנצ'מרקים של EleutherAI LM Evaluation Harness, כך שאם אתם עובדים איתה, אפשר להריץ הערכה על המודל שלכם בלי לבנות סקריפטים ידניים לפענוח הפורמט.

from datasets import load_dataset

ds = load_dataset("HAERAE-HUB/KMMLU")

הרישיון

הרישיון הוא cc-by-nd-4.0. המשמעות היא שמותר להוריד ולהשתמש בנתונים, כולל למטרות מסחריות, תוך מתן קרדיט ליוצרים. הבעיה הגדולה היא רכיב ה־ND, שאוסר על הפצה של יצירות נגזרות. אם אתם משנים את הדאטהסט, מעבדים אותו מחדש או בונים ממנו גרסה שונה, אסור לכם להפיץ אותה החוצה. לגבי מודלים שאומנו עליו יש מחלוקת משפטית ידועה בתחום סביב השאלה האם משקולות מודל נחשבות יצירה נגזרת, ולכן חברות רבות נמנעות מאימון ישיר על קבצי ND כדי לא להסתכן.

הרישיון המלא ב־Hugging Face ↗