GPT
K

KorMedMCQA

קוד פתוח

sean0042cc-by-nc-2.02024-03-05

  • medical

שאלות רב-ברירה מקוריות מתוך מבחני ההסמכה הרשמיים של מקצועות הבריאות בקוריאה. הוא רלוונטי למי שרוצה לבדוק ידע רפואי אמיתי בשפה הקוריאנית מעבר לתרגומים של בחינות אמריקאיות.

  • 1,907הורדות בחודש
  • 41לייקים

מה זה

המאגר כולל 7,469 שאלות שנלקחו ישירות ממבחני רישוי ממשלתיים בקוריאה הדרומית בין השנים 2012 עד 2024. הנתונים מחולקים לארבעה מקצועות בריאות מרכזיים: רופאים, אחיות, רוקחים ורופאי שיניים. כל רשומה מייצגת שאלת מבחן אמריקאי עם חמש אפשרויות בחירה, שנת המבחן, מועד, מספר שאלה, ותשובה נכונה שמסומנת בספרות מ־1 עד 5.

לכל מקצוע יש חלוקה מובנית לסט אימון, סט פיתוח וסט בדיקה. בגרסה המעודכנת נוסף גם פיצול מיוחד של חמש דוגמאות לכל תחום שכולל שרשרת חשיבה, כלומר הסבר מנומק שנכתב על ידי אנשי מקצוע ומפרט את שלבי הפתרון בדרך לתשובה הנכונה.

מתאים ל

  • בנצ'מרק למודלים בקוריאנית

    בדיקת יכולות הבנה וניתוח של מודלי שפה על שאלות מבחני רישוי מורכבות בקוריאנית.

  • הערכת הנמקה רפואית

    בחינת השפעת שרשרת חשיבה על דיוק התשובות בעזרת דוגמאות ההנמקה של אנשי מקצוע.

  • אימון מודלים קליניים

    כוונון עדין של מודלי שפה פתוחים על שאלות ממוקדות ברוקחות, סיעוד ורפואה כללית.

איפה זה נופל

המאגר כתוב כולו בקוריאנית בלבד, כך שאין כאן שום מילה בעברית או באנגלית והוא לא יעזור להערכת מודלים בשפות מערביות. כל השאלות משקפות רגולציה, פרוטוקולים ותוכניות לימוד מקומיות של קוריאה, שהחוקרים עצמם מצאו שאינן מתואמות היטב למבחנים אמריקאיים כמו MedQA. בנוסף, חלוקת הדאטה מוטה בגודלה: רוב המאגר נמצא במקצוע הרפואה הכללית, בזמן שבתחום רפואת השיניים סט האימון קטן מאוד וכולל 297 שאלות בלבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא רישיון לא מסחרי מסוג cc-by-nc-2.0. השימוש מוגבל למחקר, הערכה אקדמית וניסויים שאינם למטרות רווח.

האם יש במאגר שאלות או תוכן בעברית?

אין שום תוכן בעברית. כל 7,469 השאלות וההסברים כתובים בקוריאנית בלבד, בהתאם למקור המבחנים.

מה ההבדל בין המאגר הזה ל־MedQA המוכר?

MedQA מבוסס בעיקר על מבחני ההסמכה האמריקאיים באנגלית ובסינית. המאגר הזה מביא לראשונה את הסטנדרטים, המונחים והפרוטוקולים הקליניים של קוריאה הדרומית.

האם יש צורך בהרשאה מיוחדת כדי להוריד את הקבצים?

לא. הקבצים פתוחים להורדה ישירה מ־Hugging Face דרך ספריית datasets או כקובצי CSV רגילים מהמאגר.

איך טוענים

טוענים את המידע ישירות מספריית datasets לפי שם התת-תחום הרצוי: doctor, nurse, pharm או dentist. הנתונים מגיעים בקובצי CSV פתוחים ואין צורך לבקש אישור גישה מוקדם או להמתין. השדות העיקריים שמעניינים אתכם בריצה הם השאלה עצמה, חמש האפשרויות מ־A עד E, והתשובה הנכונה בשדה answer. עמודת cot מופיעה ומאוכלסת רק בפיצול ה־fewshot המיועד להערכה בהנחיה ישירה.

from datasets import load_dataset

ds = load_dataset("sean0042/KorMedMCQA")

הרישיון

הרישיון הוא cc-by-nc-2.0, מה שאומר שאסור לעשות במאגר שום שימוש מסחרי. מותר להשתמש בו למחקר, לפיתוח פנימי ולמדידות לא מסחריות, תוך מתן קרדיט מתאים ליוצרים. אם המטרה היא לאמן מודל שיימכר ללקוחות או יוטמע במוצר מסחרי, המאגר הזה פשוט חסום עבורכם.

הרישיון המלא ב־Hugging Face ↗