GPT
M

MedXpertQA

קוד פתוח

TsinghuaC3Imit2025-02-08

  • medical
  • question-answering
  • multimodal
  • reasoning
  • expert-level

מאגר מבחן עם 4,460 שאלות רפואיות ברמת מומחה, חציו טקסטואלי וחציו מולטימודלי עם תמונות ונתונים קליניים. הוא מיועד למי שרוצה לבדוק הסקה רפואית מתקדמת ולא רק שינון של עובדות פשוטות.

  • 11,129הורדות בחודש
  • 64לייקים

מה זה

המאגר כולל שאלות ברירה מרובה שנאספו ממקורות ברמת בחינות הסמכה של רופאים מומחים, ועברו סינון, הרחבה וביקורת. המבנה מחולק לשני תתי מאגרים נפרדים. הראשון הוא חלק טקסטואלי בלבד עם עשר אפשרויות בחירה לכל שאלה. החלק השני הוא מולטימודלי, מכיל חמש אפשרויות בחירה, ומשלב תמונות רפואיות לצד רשומות קליניות ותוצאות בדיקות במבנה טבלאי.

כל רשומה מכילה את השאלה, האפשרויות, התשובה הנכונה, שיוך למערכת בגוף, סיווג המשימה כמו אבחון, טיפול או רפואה בסיסית, וסיווג לפי סוג החשיבה הנדרשת, הבנה או הסקה. הנתונים מחולקים בכל תת מאגר לקובצי פיתוח ובדיקה בלבד, כך שמדובר בבנצ'מרק להערכה ולא במאגר ענק לאימון מקדים.

מתאים ל

  • הערכת מודלי ראייה רפואיים

    בדיקת יכולת המודל לפענח תמונות קליניות לצד תוצאות בדיקות טבלאיות ולהגיע לאבחנה.

  • בנצ'מרק להסקה רפואית מורכבת

    מדידת ביצועים של מודלי שפה על שאלות טקסט קשות עם עשר אפשרויות בחירה.

  • סינון מודלים לפני הטמעה

    השוואה אובייקטיבית בין מודלים שונים ברמת מומחיות קלינית לפני שילובם במערכות בריאות.

איפה זה נופל

המאגר כולו באנגלית בלבד ומבוסס על שאלות אמריקאיות קלאסיות, ללא התאמה לעברית, למונחים מקומיים בישראל או לפרוטוקולים קליניים של קופות החולים. בנוסף, עם 4,460 שאלות סך הכל, זה כלי לבדיקה ולהערכת יכולות ולא דאטהסט שמתאים לאימון מודל מאפס. אין כאן משימות של שיחה חופשית או כתיבת סיכום מחלה, אלא רק בחירה מרובה מתוך רשימת אופציות סגורה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון MIT הוא רישיון מתירני שמאפשר שימוש מסחרי מלא, כל עוד מצרפים את עותק הרישיון והקרדיט למפתחים.

האם המאגר כולל נתונים בעברית?

לא. כל השאלות, האפשרויות והרשומות הקליניות כתובות באנגלית בלבד. אם תרצו לבדוק מודל בעברית, תצטרכו לתרגם את השאלות בעצמכם.

מה מבדיל אותו ממאגרי שאלות רפואיות רגילים?

השאלות נלקחו ממקורות של בחינות מומחים ודורשות הסקה ולא רק זיהוי עובדות. בנוסף, החלק המולטימודלי משלב תמונות יחד עם מידע קליני מובנה בטבלאות ולא רק תמונה בודדת.

האם הדאטהסט מתאים לאימון מודל שפה?

לא ממש. המאגר כולל 4,460 שאלות בלבד ומחולק מראש לסט פיתוח ולסט בדיקה. הוא נבנה כבנצ'מרק להערכת ביצועים ולא כחומר גלם לאימון רחב היקף.

איך טוענים

טוענים את קובצי ה־jsonl ישירות מהמאגר, שמחולק לתיקיות Text ו־MM עם קובצי dev ו־test בכל אחת. המאגר פתוח להורדה ישירה בלי צורך באישור גישה. אם משתמשים בחלק המולטימודלי, חובה להוריד ולפרוס את הקובץ הדחוס images.zip כדי לגשת לקובצי התמונות המקושרים בשדה images. השדות המרכזיים לעיבוד הם question, options, והתווית ב־label.

from datasets import load_dataset

ds = load_dataset("TsinghuaC3I/MedXpertQA")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, שינוי, הפצה והטמעה בכל פרויקט ומודל, כולל קוד סגור, בלי חובת שיתוף באותו רישיון. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗