GPT
M

medical_meadow_medqa

קוד פתוח

medalpacaרישיון לא דווח2023-04-06

  • medical

שאלות ותשובות ממבחני הסמכה רפואיים בארצות הברית, סין וטייוואן. מי שמחפש לאמן מודל על ידע קליני מבוסס בחינות ימצא כאן חומר גולמי ממוקד באנגלית ובסינית.

  • 9,598הורדות בחודש
  • 117לייקים

מה זה

בסיס הנתונים מציג שאלות רב ברירה מקצועיות שנאספו ישירות מבחינות רפואיות בשלושה אזורים שונים: ארצות הברית, סין היבשתית וטייוואן. הרשומות מבוססות על המאמר המקורי של MedQA, שבו החוקרים קיבצו את השאלות ממאגרי בחינות רשמיים והוסיפו ספרי לימוד רפואיים באנגלית ובסינית פשוטה כדי לאפשר מענה על שאלות פתוחות. הקבצים כוללים חלוקה רשמית של הנתונים לקבוצות אימון, פיתוח ומבחן.

המבנה של כל דגימה בנוי כמילון, כאשר עבור ארצות הברית וסין הוכנה גם גרסה מותאמת שמכילה ארבע אפשרויות בחירה לכל שאלה. לצד השאלות הרגילות, המקור מספק תיקיות מיוחדות שבהן חולצו ביטויים רפואיים בעזרת הכלי Metamap, וספרי לימוד שמחולקים לפי משפטים או פסקאות מלאות. הדאטהסט הנוכחי מונגש כקובץ json יחיד תחת פרויקט medical meadow.

מתאים ל

  • אימון מודל לבחינות רפואיות

    כוונון עדין של מודלי שפה על שאלות רב ברירה קליניות באנגלית ובסינית לבדיקת ידע רפואי.

  • הערכת ביצועים בתחום הרפואה

    בדיקת יכולת המענה של מודלים קיימים מול שאלות הסמכה רשמיות מארצות הברית ומאסיה.

  • חילוץ מושגים וישויות

    בניית כלים לזיהוי מונחים רפואיים על בסיס הניתוח שבוצע באמצעות Metamap.

איפה זה נופל

החומר מכסה רק אנגלית וסינית, כך שאין כאן שום ייצוג לשפה העברית או למערכת הבריאות בישראל. הנתונים מתבססים על מאמר שפורסם במקור בשנת 2020, ולכן הם לא כוללים פרוטוקולים רפואיים חדשים שנכנסו מאז לתוקף. שאלות ממבחני הסמכה בודקות זיכרון תיאורטי וידע מובנה, הן רחוקות מאוד משיחה חיה עם מטופל או מניהול מקרה במחלקה. אם תאמנו מודל רק על החומר הזה ותנסו לתת לו לענות לחולים, תקבלו ניסוחים של שאלון אמריקאי ולא מענה קליני אמיתי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפיתוח מוצר מסחרי?

לא מומלץ בכלל. בעמוד המאגר לא מופיע שום רישיון, ומבחינה חוקית אין לכם הרשאה לבנות ממנו מוצר רווחי. בנוסף, השאלות עצמן מגיעות מספרי לימוד ומבחינות רשמיות עם זכויות יוצרים של גורמים שלישיים.

האם יש במאגר נתונים או שאלות בעברית?

אין במאגר עברית בכלל. כל הנתונים מגיעים משלושה מקורות בלבד והם כתובים באנגלית או בסינית. אם המטרה שלכם היא לאמן מודל שמבין מונחים רפואיים מקומיים, תצטרכו לתרגם את החומר או לאסוף דאטה מקומי.

איך נאספו השאלות שמופיעות בקבצים?

הנתונים נלקחו ישירות מתוך מבחני הסמכה רפואיים שנערכו בארצות הברית, בסין היבשתית ובטייוואן. החוקרים ליקטו את השאלות ממאגרי בחינות וצירפו אליהן ספרי לימוד רפואיים כדי לספק את הרקע המדעי הדרוש לפתרון.

באיזה פורמט המידע שמור ואיך ניגשים אליו?

המידע בפרויקט הזה ארוז בקובץ json יחיד שנקרא medical_meadow_medqa.json. המאגר כולל שלושה קבצים בסך הכל ואינו דורש הרשמה או אישור מיוחד, כך שאפשר למשוך אותו מיד בעזרת ספריית datasets הרגילה.

איך טוענים

אתם מושכים את הקובץ ישירות מתוך המאגר של Hugging Face בלי צורך בהרשאות מיוחדות, טפסי בקשה או אישור גישה ידני. במאגר יושבים שלושה קבצים בלבד, כשהמידע עצמו מרוכז בקובץ medical_meadow_medqa.json. כדי לעבוד איתו בצורה נכונה צריך לפרק את מבנה ה־json ולשלוף את השדות שמכילים את השאלה, האפשרויות והתשובה הנכונה. הקובץ זמין להורדה מיידית ומתאים לטעינה ישירה בסקריפטים של פייתון.

from datasets import load_dataset

ds = load_dataset("medalpaca/medical_meadow_medqa")

הרישיון

היוצרים לא דיווחו על רישיון שימוש במאגר הזה. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בחומר, בטח שלא לפיתוח מוצרים מסחריים או לאימון מודלים שיימכרו ללקוחות. החומרים נאספו ממבחנים ומספרי לימוד שזכויות היוצרים עליהם מורכבות ממילא. כל עוד לא מוגדר רישיון ברור, הסיכון המשפטי נופל כולו עליכם, ומוטב להתייחס אל המאגר כחומר למחקר אקדמי בלבד.

הרישיון המלא ב־Hugging Face ↗