GPT
H

head_qa

קוד פתוח

dvilaresmit2022-03-02

שאלות רב-ברירה מקצועיות ממבחני הסמכה של מערכת הבריאות בספרד. הן דורשות ידע מעמיק ברפואה, סיעוד ורוקחות, ומתאימות לבדיקת יכולות הסקת מסקנות מתקדמות של מודלים.

  • 7,341הורדות בחודש
  • 22לייקים

מה זה

כל רשומה מייצגת שאלת מבחן וכוללת את מזהה השאלה, תחום ההתמחות, טקסט השאלה, רשימת תשובות אפשריות עם מזהה מספרי, התשובה הנכונה, שם המבחן והשנה שלו. בחלק מהמקרים מצורפת תמונה שמלווה את השאלה כקובץ גרפי. התחומים מכסים רפואה, סיעוד, פסיכולוגיה, כימיה, רוקחות וביולוגיה.

המקור מגיע ישירות ממבחני ההסמכה הרשמיים של משרד הבריאות הספרדי שנאספו על פני חמש שנים, עד לעדכון האחרון בינואר 2019. השאלות מוצגות בספרדית ובגרסה מתורגמת לאנגלית. אין כאן תיוגים מורכבים מעבר למבנה השאלה המקורי.

החלוקה קבועה עבור שתי השפות: 2,657 שאלות בערכת האימון, 1,366 שאלות בערכת הוולידציה, ו־2,742 שאלות בערכת הבחינה.

מתאים ל

  • הערכת ידע קליני

    בדיקת יכולת המודל לענות על שאלות ברמת מבחני הסמכה רפואיים באנגלית או בספרדית.

  • מבחן ביצועים רב-לשוני

    השוואת ביצועי המודל בין שאלות המקור בספרדית לתרגום המקביל שלהן באנגלית.

  • ניתוח שאלות עם תמונה

    אימון ובחינה של מודלים מולטימודליים על שאלות רפואיות שמשלבות תרשימים ודימות.

איפה זה נופל

החומר מתבסס על מבחנים עד שנת 2019 ממערכת הבריאות הספרדית בלבד. פרוטוקולים רפואיים, שמות מסחריים של תרופות ודגשים קליניים משקפים את התקופה והרגולציה המקומית בספרד. הטקסט קיים בספרדית ובאנגלית בלבד, ואין שום תמיכה בעברית או התאמה למערכת הבריאות בישראל. בנוסף, קיימת כבר גרסה שנייה של המאגר ברשת שמכילה שנים חדשות יותר, כך שהגרסה הזו חלקית ומיושנת יחסית.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, רישיון MIT מתיר שימוש מסחרי. יש לוודא שעומדים בדרישות משרד הבריאות הספרדי, הכוללות ייחוס מקור, הצגת תאריך העדכון מ־2019 והימנעות מעיוות התוכן המקורי של הבחינות.

האם המאגר כולל עברית?

לא. השאלות קיימות בספרדית ובאנגלית בלבד. כדי להשתמש בו בהקשר מקומי בישראל תצטרכו לתרגם את השאלות ולהתאים מונחים ופרוטוקולים רפואיים.

מאיפה הגיעו הנתונים ומי חיבר אותם?

השאלות נכתבו על ידי משרד הבריאות הספרדי עבור בחינות ההסמכה הרשמיות למקצועות הרפואה. החוקרים דוד וילארס וקרלוס גומז-רודריגז אספו וארגנו אותן עבור קהילת הבינה המלאכותית.

האם כדאי להשתמש במאגר הזה או בגרסה השנייה שלו?

מומלץ לבדוק קודם את גרסה 2 של HEAD-QA. הכרטיס מציין שגרסה 2 כוללת יותר שאלות, טווח שנים רחב יותר ותמיכה בשפות נוספות, ולכן היא עדיפה לרוב הפרויקטים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה dvilares/head_qa. ברירת המחדל מושכת את הגרסה הספרדית, וכדי לקבל את הגרסה האנגלית מעבירים את המחרוזת en כפרמטר תצורה. הגישה חופשית ואינה דורשת אישור מקדים.

שימו לב לעמודת התמונה: גישה לעמודה ברמת הטבלה מפענחת את כל התמונות בבת אחת ומאטה את הריצה באופן קיצוני. מומלץ לגשת קודם לאינדקס של השורה ורק אז לשדה התמונה. השדות העיקריים לעבודה הם qtext לשאלה, answers לתשובות ו־ra למזהה התשובה הנכונה.

from datasets import load_dataset

ds = load_dataset("dvilares/head_qa")

הרישיון

המאגר מופץ תחת רישיון MIT שמתיר שימוש חופשי, כולל אימון מודלים ושימוש מסחרי, בכפוף למתן קרדיט. יחד עם זאת, משרד הבריאות הספרדי דורש תנאים נוספים על תוכן הבחינות המקורי: איסור על עיוות התוכן, חובת ציון המקור וציון תאריך העדכון האחרון של המסמכים, שהוא 14 בינואר 2019.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗