GPT
M

medical_dialog

קוד פתוח

UCSD26unknown2022-03-02

שיחות אמיתיות בין רופאים למטופלים באנגלית ובסינית, שנאספו מאתרי ייעוץ רפואי ברשת. חוקרים מגיעים אליו כשצריך לאמן מודלים על דיאלוג רפואי חי במקום על שאלות ותשובות סינתטיות.

  • 1,096הורדות בחודש
  • 177לייקים

מה זה

המאגר מכיל תמלולי התכתבויות רפואיות בין רופאים למטופלים. בגרסה האנגלית המידע מגיע מאתרים כמו icliniq.com, healthcaremagic.com ו־healthtap.com, ובגרסה הסינית המקור הוא האתר haodf.com. כל רשומה כוללת תיאור של מצב המטופל ואת רצף חילופי הדברים בינו לבין הרופא, כשבחלק הסיני מופיעים לעיתים גם אבחנה והמלצות לטיפול.

יש כאן ארבע תצורות עבודה שונות. שתי תצורות גולמיות לשתי השפות ללא חלוקה מראש, ותצורות מעובדות עם חלוקה לסט אימון, ולידציה ובדיקה. החלוקה הזו מציגה פער חריג מאוד בין השפות: בעוד שבגרסה המעובדת בסינית יש מעל 2.7 מיליון רשומות אימון ועוד מאות אלפים לבדיקה, הגרסה המעובדת באנגלית נותרה עם 482 דוגמאות אימון, 60 לוולידציה ו־61 לבדיקה בלבד, לעומת כ־229 אלף רשומות שקיימות בפורמט הגולמי באנגלית. הכרטיס לא מפרט תהליך סינון או ניקוי כלשהו שבוצע על הנתונים.

מתאים ל

  • אימון צ'אטבוט רפואי בסינית

    למידה על מיליוני דיאלוגים מ־haodf.com לצורך שיפור מענה אוטומטי לשאלות מטופלים.

  • מחקר אקדמי על דיאלוג

    בדיקת ארכיטקטורות של מודלי שפה על שיחות סגורות בתחום הרפואה לצרכי פרסום ומחקר.

  • הערכת מודלים באנגלית

    שימוש במאות הרשומות של processed.en כדי לבדוק איך מודל קיים מתמודד עם ניסוח רפואי של מטופל.

איפה זה נופל

הבעיה הגדולה ביותר כאן היא חוסר תיעוד מוחלט. הכרטיס משאיר תחת הכותרת מידע נדרש את כל הסעיפים הקריטיים: אין מילה על הסרת פרטים מזהים ומידע רפואי רגיש, אין בדיקה של הטיות מקצועיות או שגיאות רפואיות בתשובות הרופאים, ואין הסבר על תהליך האיסוף. בנוסף, אין כאן עברית בכלל, והגרסה המעובדת באנגלית קטנה מדי לכל שימוש רציני. לא הייתי נוגע בזה למוצר קליני בלי להעביר את כל הטקסטים בדיקה אנושית וסינון פרטיות עצמאי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

חד משמעית לא. תנאי השימוש של האתרים שממנם נסרק המידע אוסרים סריקה ושימוש מסחרי, וליוצרי המאגר אין רישיון להעניק לכם. מודל שתאמנו על זה עלול להסתבך בהפרת זכויות יוצרים.

האם יש במאגר שיחות בעברית?

לא. המאגר מכיל שיחות בשתי שפות בלבד, אנגלית וסינית, שנאספו מאתרים אמריקאיים וסיניים.

מדוע יש כל כך מעט דוגמאות בגרסה המעובדת באנגלית?

בגרסה הגולמית באנגלית יש כ־229 אלף שיחות, אך בגרסה המעובדת (processed.en) מופיעות רק 482 דוגמאות אימון. הכרטיס לא מסביר מדוע הרוב נחתך בעיבוד, ולכן אם אתם צריכים נפח עבודה באנגלית תצטרכו לנקות ולעבד את הגרסה הגולמית לבד.

האם המידע הרפואי והאישי של המטופלים עבר אנונימיזציה?

הכרטיס משאיר את סעיף המידע האישי והרגיש ריק תחת More Information Needed. אי אפשר להסתמך על כך שהשמות, הגילאים או הפרטים הרפואיים המזהים נמחקו, וחובה לסנן אותם עצמאית לפני כל פעולה.

איך טוענים

טוענים את הדאטהסט ישירות דרך הספרייה הרגילה באמצעות סקריפט הטעינה medical_dialog.py שמגיע במאגר, ללא צורך בהרשאת גישה מיוחדת. צריך להגדיר מראש את התצורה הרצויה, en, zh, או הגרסאות המעובדות processed. השדות העיקריים שמעניינים אתכם הם utterances שמכיל את הטקסטים עצמם, או dialogue_turns בגרסאות הגולמיות, שם מקבלים רשימה מסודרת של הדובר והאמירה לצד dialogue_url ו־dialogue_id.

from datasets import load_dataset

ds = load_dataset("UCSD26/medical_dialog")

הרישיון

הרישיון מוגדר כלא ידוע, ובפועל יש כאן בעיה משפטית גלויה. החוקרים מציינים שהנתונים נסרקו מהאתרים haodf.com, icliniq.com ו־healthcaremagic.com, וזכויות היוצרים שייכות להם. יתרה מזו, תנאי השימוש של האתרים האנגליים אוסרים במפורש על סריקה, העתקה או שימוש מסחרי במידע. המשמעות היא שאימון מודל על המאגר הזה, בוודאי לשימוש מסחרי, חושף אתכם לתביעות ואינו מומלץ בעליל.

הרישיון המלא ב־Hugging Face ↗