GPT
M

medmcqa

קוד פתוח

openlifescienceaiapache-2.02022-05-06

מעל 194 אלף שאלות אמריקאיות ממבחני קבלה רפואיים בהודו, כולל הסברים מפורטים. מקור מצוין למי שרוצה לאמן או לבחון מודלים על ידע קליני מקצועי ומורכב באנגלית.

  • 192,723הורדות בחודש
  • 235לייקים

מה זה

המאגר כולל שאלות ממבחני ההסמכה ההודיים AIIMS ו־NEET PG, לצד מבחני תרגול שנאספו מאתרים וספרים. כל רשומה מכילה את גוף השאלה, ארבע אפשרויות בחירה, התשובה הנכונה, סוג הבחירה, נושא ותחום רפואי, וכן הסבר מפורט של מומחה לפתרון. הנתונים מכסים 21 תחומים שונים, מאנטומיה ופרמקולוגיה ועד כירורגיה ורפואת שיניים, עם פריסה של כ־2,400 נושאי בריאות.

החלוקה לא נעשתה באופן אקראי אלא לפי מקור המבחן כדי לבדוק יכולת הכללה אמיתית. קבוצת האימון מונה 182,822 שאלות שמגיעות ממבחני תרגול מקוונים. קבוצת הפיתוח מכילה 4,183 שאלות ממבחני NEET PG החל משנת 2001, וקבוצת המבחן כוללת 6,150 שאלות ממבחני AIIMS משנת 1991 ואילך. שאלות דומות בין החלקים הוסרו לפי דמיון טקסטואלי.

מתאים ל

  • הערכת מודלים רפואיים

    בחינת יכולות הסקת מסקנות וידע קליני באנגלית על מבחני כניסה אמיתיים.

  • אימון שאלות ותשובות

    כוונון עדין של מודלי שפה לבחירה מרובה עם הסברים מנומקים.

  • סיווג נושאים רפואיים

    אימון ממיינים לטקסט רפואי לפי 21 תחומים ו־2,400 תתי נושאים.

איפה זה נופל

כל השאלות וההסברים כתובים באנגלית בלבד, ואין כאן מילה בעברית או התאמה לרפואה מקומית. החומר משקף את תוכנית הלימודים והבחינות בהודו, החל משנת 1991, כך שחלק מהשאלות הישנות עשויות להכיל פרוטוקולים לא מעודכנים. מעבר לכך, יוצרי המאגר השאירו את סעיפי המגבלות וההטיות בכרטיס ריקים, כך שאין מידע מתועד על הטיות אפשריות בנתונים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא apache-2.0, ולכן מותר לאמן עליו מודלים מסחריים ולשלב אותם באפליקציות סגורות. התנאי היחיד הוא שמירה על זכויות היוצרים וייחוס ליוצרי המאגר.

האם הדאטהסט כולל שאלות בעברית?

לא. כל השאלות, התשובות וההסברים נאספו ממבחנים הודיים וכתובים באנגלית בלבד. אם המטרה היא עבודה בעברית, תצטרכו לתרגם את הנתונים באופן עצמאי.

מאיפה הנתונים נאספו במקור?

הנתונים נלקחו מאתרים פתוחים ומספרים של בחינות ההסמכה ההודיות AIIMS ו־NEET PG משנים 1991 ועד היום. חלק האימון מכיל בעיקר סדרות תרגול ומבחני דמה מאותם מקורות.

במה הוא שונה מדאטהסטים רפואיים אחרים?

הוא מתמקד בשאלות מבחן קליניות מורכבות שמצריכות ידע מקצועי מעמיק, להבדיל משאלות של מטופלים מפורומים. בנוסף, הוא כולל הסבר פתרון מלא לכל שאלה ולא רק את התשובה הנכונה.

איך טוענים

הנתונים שמורים בקובצי Parquet מחולקים מראש לפי קבוצות, ללא צורך באישור גישה או הרשמה מיוחדת. אפשר לטעון ישירות דרך ספריית datasets הרגילה. המבנה פשוט מאוד, אבל שימו לב לשדה cop שמחזיק את אינדקס התשובה הנכונה כמספר בין אחת לארבע, ולשדה choice_type שמבדיל בין שאלה עם אפשרות יחידה לשאלה שמשלבת תתי אפשרויות. שדה ההסבר exp חיוני במיוחד אם אתם מאמנים מודל לנמק את התשובות שלו.

from datasets import load_dataset

ds = load_dataset("openlifescienceai/medmcqa")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי ומחקרי חופשי לחלוטין, כולל שינוי, הפצה ואימון של מודלים סגורים או פתוחים. הדרישה העיקרית היא הכללת עותק הרישיון ומתן ייחוס מתאים ליוצרים, ללא חובת שיתוף של הנגזרות באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗