GPT
P

PMC-Patients

קוד פתוח

zhengyun21cc-by-nc-sa-4.02023-04-25

  • patient summary
  • medical
  • biology

מאגר של מאות אלפי סיכומי חולים שנשלפו מתוך תיאורי מקרה רפואיים, כולל קשרי דמיון וציטוטים ביניהם. הוא מיועד למי שמפתח מערכות אחזור רפואיות ומחפש נתונים עם הקשר קליני אמיתי.

  • 640הורדות בחודש
  • 147לייקים

מה זה

הבסיס כאן הוא סיכומי חולים שנחתכו מתוך דוחות מקרה בתוך מאגר PubMed Central. הגרסה הראשונה כללה כ־167 אלף סיכומים עם 3.1 מיליון קישורי רלוונטיות למאמרים וכ־293 אלף צמדי חולים דומים, כולם מבוססים על גרף הציטוטים של PubMed. גרסה שתיים מעלה את המספר ל־250,294 מטופלים על בסיס נתוני 2024 באותו תהליך איסוף בדיוק.

כל רשומה כוללת מזהה ייחודי שקושר את החולה למאמר המקור, כותרת, נתיב קובץ, וטקסט חופשי שמתאר את המקרה. לצד הטקסט מופיעים נתונים מובנים של גיל, מגדר, ומילונים שמדרגים דמיון לחולים אחרים או רלוונטיות למאמרים רפואיים בציונים של 1 או 2.

מתאים ל

  • אחזור חולים דומים

    אימון מודלים להשוואת מקרי בוחן ומציאת מטופלים עם מהלך מחלה מקביל לפי סימפטומים.

  • חיפוש מאמרים רלוונטיים

    טיוב מערכות שמקבלות תיאור מקרה ומאתרות את הספרות הרפואית המתאימה ביותר לטיפול.

  • חילוץ ישויות רפואיות

    הערכת ביצועים של מודלי שפה על טקסט קליני חופשי מול שדות מובנים כמו גיל ומגדר.

איפה זה נופל

הטקסט כולו באנגלית בלבד. אם המטרה היא עבודה מול מערכת בריאות בישראל או טקסטים בעברית, אין פה מענה ישיר. מעבר לזה, הנתונים נשענים על תיאורי מקרה שפורסמו בספרות הרפואית, מה שאומר שיש הטיה מובנית למקרים נדירים, חריגים או מורכבים יותר ממה שרופא פוגש ביום יום. קשרי הרלוונטיות והדמיון לא נבדקו ידנית על ידי רופאים עבור כל צמד, אלא נגזרו מגרף הציטוטים של המאמרים, ולכן הם מכילים רעש שצריך לקחת בחשבון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא רישיון לא מסחרי עם דרישה לשיתוף זהה. כל מודל או תוצר שתאמנו על הנתונים האלה לא יוכל לשמש בפעילות מסחרית.

האם יש בדאטהסט נתונים בעברית?

אין עברית בכלל. כל הנתונים נאספו ממאמרים באנגלית שפורסמו ב־PubMed Central, כך שכל סיכומי המטופלים כתובים באנגלית רפואית בלבד.

איך נקבע איזה חולה דומה לחולה אחר?

החוקרים השתמשו בגרף הציטוטים של המאמרים המקוריים ב־PubMed. הדמיון והרלוונטיות מבוססים על קשרים ביבליוגרפיים ולא על תיוג ידני שבוצע בידי רופאים.

מה ההבדל בין קובץ ה־CSV לקובץ ה־JSON במאגר?

קובץ ה־CSV שייך לגרסה הראשונה ומכיל כ־167 אלף מטופלים. קובץ ה־JSON מייצג את גרסה שתיים, מתבסס על נתוני 2024 ומכיל מעל 250 אלף מטופלים באותו מבנה נתונים.

איך טוענים

המאגר פתוח להורדה ישירה דרך Hugging Face ואין צורך בהרשאה מיוחדת. הנתונים מגיעים בקובץ CSV עבור הגרסה הראשונה ובקובץ JSON עבור גרסה שתיים, שניהם שומרים על אותם שדות מפתח. מומלץ לגשת ישר לגרסת ה־JSON כדי לקבל את היקף הנתונים המלא, ולהתמקד בשדות של טקסט המטופל והמילונים של החולים הדומים כדי לבנות את משימות הדירוג והאימון.

from datasets import load_dataset

ds = load_dataset("zhengyun21/PMC-Patients")

הרישיון

הרישיון הוא cc-by-nc-sa-4.0. המשמעות ברורה וסוגרת דלתות: השימוש מותר למחקר ולמטרות לא מסחריות בלבד, תוך מתן קרדיט ושיתוף כל נגזרת באותו רישיון בדיוק. אי אפשר לאמן על זה מודל שייכנס למוצר מסחרי סגור או שיימכר ללקוחות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗