GPT
A

Asclepius-Synthetic-Clinical-Notes

קוד פתוח

starmpcccc-by-nc-sa-4.02023-09-01

  • medical
  • synthetic

המאגר כולל סיכומי אשפוז סינתטיים וצמדי שאלות ותשובות באנגלית שנוצרו עם מודל שפה. הוא מיועד למי שרוצה לאמן מודלים רפואיים בלי להסתבך עם אישורי גישה למידע רפואי רגיש.

  • 969הורדות בחודש
  • 116לייקים

מה זה

המאגר נבנה כדי לעקוף את בעיית הגישה לתיקים רפואיים חסויים. הבסיס מגיע מתוך PMC Patients, מאגר פומבי של תיאורי מקרים רפואיים ממאמרים מדעיים. החוקרים לקחו את תיאורי המקרים, יצרו בעזרת GPT 3.5 סיכומי אשפוז סינתטיים, וגזרו מהם צמדי הנחיה ותשובה סביב המידע הקליני.

המבנה של הרשומות מוגדר סביב חמישה שדות עיקריים בקובץ הנתונים. שדה המזהה מקשר לדיווח המקורי, שדה הטקסט מחזיק את תיאור המקרה, ולצידם מופיעות השאלה והתשובה שנוצרו על ידי המודל. בנוסף ישנו שדה משימה שמסווג כל שאלה לאחת מתוך שמונה קטגוריות שונות, בהן זיהוי ישויות, פתיחת ראשי תיבות, חילוץ יחסים, חילוץ מידע של זמנים, שאלות ותשובות, תמצות, ניסוח מחדש ופתרון אזכורים.

בסך הכל המאגר מחזיק בין מאה אלף למיליון רשומות, וכולל 157 אלף סיכומי אשפוז סינתטיים. הנתונים מתמקדים באנגלית בלבד, וכל המשימות מתבססות על ההקשר של תיאור המקרה הרפואי שסופק למודל בזמן היצירה.

מתאים ל

  • אימון מודל רפואי להוראות

    כוונון עדין של מודלי שפה פתוחים על משימות קליניות כמו מענה לשאלות ותמצות.

  • חילוץ ישויות וראשי תיבות

    אימון מודלים לזיהוי מונחים רפואיים ופתיחת קיצורים מתוך סיכומי מחלה.

  • מבחן ביצועים למחקר

    הערכת היכולת של מודלים להתמודד עם שמונה משימות שפה קליניות שונות באנגלית.

איפה זה נופל

החולשה העיקרית היא שהטקסטים והתשובות נוצרו כולם על ידי גרסת מרץ של GPT 3.5. זה אומר שהמאגר נושא איתו הזיות, טעויות קליניות ודפוסי ניסוח קבועים של המודל הזה. הנתונים מוגבלים לחלוטין לשפה האנגלית ולא מציגים תיקים רפואיים אמיתיים עם שגיאות הקלדה, מבנה שבור או סלנג מקומי. אסור לבנות על זה כלי שמשפיע על החלטות רפואיות בלי בדיקה קלינית אנושית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא מסוג לא מסחרי, כך שכל שימוש בו מוגבל למחקר בלבד. מעבר לזה, תנאי השיתוף הזהה מחייבים לשחרר כל מודל שאומן עליו באותו רישיון.

האם המאגר כולל רשומות בעברית?

לא, הנתונים כולם באנגלית בלבד. הם נוצרו על בסיס מאמרים מדעיים באנגלית שנלקחו ממאגר PMC Patients.

מאיפה הנתונים האלה הגיעו בפועל?

הבסיס הוא תיאורי מקרים ממאמרים רפואיים פומביים. מתוכם ייצרו החוקרים סיכומי אשפוז סינתטיים וצמדי שאלות ותשובות באמצעות מודל GPT 3.5.

האם צריך אישור מיוחד או מעבר קורס כדי להוריד את הקבצים?

אין צורך באישורים מיוחדים בניגוד למאגרי בית חולים רגילים. הקובץ פתוח להורדה ישירה מחשבון היוצר.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הנתונים של Hugging Face או על ידי הורדת הקובץ synthetic.csv. אין צורך באישור גישה או בחתימה על הסכמי סודיות רפואיים. בפנים תמצאו את עמודות הטקסט הרפואי, השאלות, התשובות ושם המשימה, כך שקל לסנן רק דוגמאות של משימה ספציפית כמו סיכום או שאלות ותשובות לפני שמתחילים באימון.

from datasets import load_dataset

ds = load_dataset("starmpcc/Asclepius-Synthetic-Clinical-Notes")

הרישיון

הרישיון הוא cc by nc sa 4.0. המשמעות היא איסור מוחלט על שימוש מסחרי, חובת ייחוס ליוצרים, ודרישה שכל תוצר או מודל שתאמנו על הדאטהסט ישוחרר תחת אותו רישיון בדיוק. המאגר מתאים למחקר אקדמי בלבד ולא למוצרים מסחריים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗