GPT
A

augmented-clinical-notes

קוד פתוח

AGBonnetmit2024-01-15

  • medical
  • health

המאגר מחבר בין סיכומי חולים ממאמרים רפואיים, שיחות סינתטיות של רופא ומטופל, ומידע קליני מובנה. הוא מיועד למי שרוצה לאמן מודלים להפקת תיעוד רפואי משיחה או מטקסט חופשי.

  • 1,209הורדות בחודש
  • 75לייקים

מה זה

הנתונים בנויים משלשות של שיחה, סיכום והערה רפואית. הבסיס מגיע מתוך מאגר PMC-Patients, שכולל מקרים קליניים שפורסמו במאמרים פתוחים ב־PubMed Central. המפתחים לקחו את שלושים אלף ההערות הארוכות ביותר מתוכו, והצליבו אותן עם שיחות סינתטיות בין רופא לחולה שנלקחו ממאגר NoteChat.

התוספת המרכזית כאן היא שדה הסיכום המובנה. המפתחים הריצו את gpt-4-turbo-0613 עם תבנית מוגדרת כדי לחלץ מההערות הקליניות את פרטי הקבלה למרפאה, היסטוריה רפואית, תסמינים, אבחנה ותוכנית טיפול. התוצאה היא קובץ שבו כל רשומה כוללת את השיחה, ההערה המקורית, ההערה המלאה, והמידע הרפואי שחולץ לתוך פורמט מובנה.

מתאים ל

  • חילוץ מידע רפואי משיחה

    אימון מודלים שלומדים שיחת מטופל ומפיקים ממנה סיכום מובנה של תסמינים ותוכנית טיפול.

  • הבניית סיכומי מחלה

    המרת טקסט רפואי חופשי ממכתבי שחרור לשדות מוגדרים לפי תבנית קלינית.

  • הערכת מודלי שפה רפואיים

    בדיקת היכולת של מודלים לחלץ אבחנות מדויקות מתוך תיאורי מקרים מורכבים.

איפה זה נופל

הבעיה המרכזית היא איכות השיחות. הדיאלוגים יוצרו באמצעות GPT 3.5 והם לא נשמעים כמו שיחה אמיתית במרפאה. ברוב המקרים הרופא פשוט שואל שאלות ישירות מתוך ההערה והמטופל עונה לו כן קצר. בנוסף, בחלק מהשיחות התגלו דליפות של הפרומפט המקורי לתוך הטקסט, בעיקר במקרים שבהם המטופל נפטר והשיחה המשיכה עם בן משפחה. הטקסטים כולם באנגלית ומבוססים על ספרות אקדמית מערבית, כך שאין כאן שום ייצוג לעברית או לדפוסי שיחה מקומיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוגדר הוא MIT, שמתיר שימוש מסחרי חופשי. יש לכלול את הצהרת זכויות היוצרים המקורית בעת השימוש או ההפצה של הנתונים.

האם יש במאגר נתונים בעברית?

לא, כל החומרים נאספו ממאמרים רפואיים באנגלית שפורסמו ב־PubMed Central. אין במאגר טקסטים או דיאלוגים בעברית.

מאיפה הגיעו השיחות בין הרופא למטופל?

השיחות הן סינתטיות לחלוטין ואינן הקלטות של אנשים אמיתיים. הן הופקו על ידי מודל GPT 3.5 על בסיס תיאורי המקרים, מכיוון שחוקי פרטיות רפואיים בארצות הברית אוסרים על הפצת שיחות אמיתיות.

מה ההבדל בין הערה רגילה להערה מלאה ברשומות?

השדה note מכיל את הטקסט המקוצר ששימש ליצירת השיחה הסינתטית ב־NoteChat, כדי למנוע הזיות בסוף הטקסט. השדה full_note מכיל את תיאור המקרה המקורי והמלא שנלקח מ־PMC-Patients.

איך טוענים

טוענים את הקובץ augmented_notes_30K.jsonl ישירות דרך ספריית datasets או בקריאת קובץ פשוטה. אין צורך בבקשת גישה מיוחדת, והכל זמין להורדה מיידית. כל שורה מכילה חמישה שדות טקסט: מזהה, הערה מקוצרת, הערה מלאה, שיחה וסיכום בפורמט JSON. במאגר יש גם קובץ בשם template_definitions.json שמגדיר את מבנה הסיכום, ודוחות PDF שמתארים את תהליך עיבוד הנתונים.

from datasets import load_dataset

ds = load_dataset("AGBonnet/augmented-clinical-notes")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים המקורית. אפשר להשתמש בנתונים כדי לאמן מודלים פנימיים או מסחריים בלי חובת שיתוף של הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗