GPT
C

CLIcK

קוד פתוח

EunsuKimרישיון לא דווח2024-03-19

  • Culture
  • Language

שאלות אמריקאיות להערכת מודלי שפה על ידע תרבותי ולשוני בקוריאנית. המאגר בודק הבנה מקומית עמוקה שלא קיימת במבחנים גלובליים מתורגמים.

  • 5,426הורדות בחודש
  • 28לייקים

מה זה

המאגר כולל בין אלף לעשרת אלפים שאלות רב ברירה בקוריאנית, שמחולקות לשני תחומים מרכזיים: שפה ותרבות. תחום השפה מפרק את הידע לשלושה חלקים, ובהם ידע טקסטואלי, דקדוקי ותפקודי. תחום התרבות מחולק לשמונה נושאים ספציפיים שכוללים חברה, מסורת, פוליטיקה, כלכלה, משפט, היסטוריה, גיאוגרפיה ותרבות פופולרית מקומית.

איסוף הנתונים נשען על שני מקורות עיקריים. חלק מהשאלות עבר סיווג מחדש מתוך מבחנים רשמיים בקוריאה, כמו בחינות כניסה לאוניברסיטה, מבחני שירות מדינה, מבחני שליטה בקוריאנית ומבחני הגירה. החלק השני נוצר באמצעות מודל שהפיק שאלות מחומרי לימוד רשמיים של משרד המשפטים הקוריאני, ולאחר מכן עבר תהליך אימות של צוות המחקר.

מתאים ל

  • הערכת מודלים בקוריאנית

    בדיקת ביצועים של מודלי שפה על שאלות רב ברירה בדקדוק, ידע טקסטואלי ומבנה הלשון הקוריאנית.

  • מדידת הבנה תרבותית

    בחינת הידע של המודל בנושאי היסטוריה, פוליטיקה, משפט, כלכלה ותרבות מקומית בקוריאה.

  • השוואת ביצועים מול בנצ'מרק

    השוואת תוצאות המודל מול הציונים שמפורסמים במחקר המקורי עבור מודלים מובילים.

איפה זה נופל

הנתונים כולם בקוריאנית בלבד, כך שאין כאן שום מידע בעברית או באנגלית והוא לא מתאים למשימות מחוץ להקשר הקוריאני. בנוסף, חלק מהשאלות לא מגיע ממבחנים שנכתבו בידי בני אדם אלא יוצר באופן סינתטי באמצעות בינה מלאכותית מחומרי משרד המשפטים, מה שמחייב לבדוק ידנית מדגמים כדי לוודא שאין ניסוחים רובוטיים או טעויות שנפלו באימות. כדאי גם לשים לב שהשאלות ממבחנים רשמיים מייצגות ידע פורמלי של מערכת החינוך והממשל, ולא בהכרח שפת דיבור יומיומית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא. דף הדאטהסט לא מציג רישיון שימוש, ולכן על פי חוקי זכויות יוצרים כל הזכויות שמורות. שימוש מסחרי, אימון מודל לחברה או הפצה של הנתונים כרוכים בסיכון משפטי ודורשים פנייה ליוצרים.

האם יש במאגר שאלות בעברית או תרגום כלשהו?

אין במאגר עברית בכלל. כל הנתונים כתובים בקוריאנית בלבד, והשאלות מיועדות לבדיקת ידע לשוני ותרבותי ספציפי לקוריאה.

איך נאספו השאלות שמופיעות בקבצים?

המאגר משלב שאלות שנלקחו מתוך בחינות ממשלתיות ואקדמיות רשמיות בקוריאה יחד עם שאלות סינתטיות שנוצרו בעזרת בינה מלאכותית על בסיס חוברות לימוד של משרד המשפטים המקומי. כל השאלות סווגו מחדש ועברו בדיקה של החוקרים.

איך טוענים

המאגר זמין להורדה ישירה ללא צורך בהרשמה מוקדמת או באישור גישה מיוחד. הנתונים מאורגנים בתוך תיקיית Dataset המחולקת לתיקיות משנה לפי שני התחומים, Culture ו־Language. סך הכל תמצאו שם 28 קובצי JSON נפרדים, שכל אחד מהם מייצג תת נושא ומקור מבחן ספציפי, למשל שאלות כלכלה ממבחן ההגירה או שאלות גיאוגרפיה מבחינת הכניסה לאוניברסיטה. כדי להריץ עליו מבחן הערכה תצטרכו לטעון את קובצי ה־JSON ישירות או דרך הספרייה של Hugging Face, ולחלץ את השאלות, האפשרויות והתשובות הנכונות מתוך המבנה של כל קובץ.

from datasets import load_dataset

ds = load_dataset("EunsuKim/CLIcK")

הרישיון

היוצרים לא הגדירו רישיון בדף המאגר. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות למחברים ולמקורות המקוריים כמו משרד המשפטים הקוריאני וגופי הבחינות. המשמעות היא שאסור להשתמש בנתונים לפיתוח מוצרים מסחריים, אימון מודלים פנימיים בחברות או הפצה מחדש, אלא אם קיבלתם אישור ישיר בכתב מבעלי הזכויות.

הרישיון המלא ב־Hugging Face ↗