GPT
M

medical-dialogue-to-soap-summary

קוד פתוח

omi-healthרישיון לא דווח2024-04-14

המאגר כולל עשרת אלפים שיחות קליניות סינתטיות עם סיכומי סבון תואמים שנבנו באמצעות מודל שפה. הוא מיועד למי שמפתח מודלים לתיעוד רפואי אוטומטי וזקוק לשיחות מובנות.

  • 795הורדות בחודש
  • 79לייקים

מה זה

הרשומות מבוססות על תיאורי מקרים ממאגר פאבמד סנטרל, שעובדו במקור במסגרת פרויקט נוט צ'ט. החוקרים השתמשו בג'יפיטי 4 כדי לקחת את התיאורים האלה ולייצר מהם שיחות מדומות בין מטופל לקלינאי, ובנוסף הפיקו באמצעות המודל סיכומים קליניים במבנה סבון.

המאגר כולל עשרת אלפים דוגמאות שמחולקות לשלושה קבצים: תשעת אלפים מאתיים וחמישים רשומות לאימון, חמש מאות לוולידציה ומאתיים וחמישים לבדיקה. כל רשומה כוללת ארבע עמודות שמרכזות את השיחה עצמה, את סיכום הסבון, את הפרומפט ששימש ליצירה, ועמודה שמציגה את השיחה בפורמט צ'אט אמ אל מוכן לעבודה.

הכרטיס לא מפרט תהליכי סינון ידניים או בדיקות בקרת איכות אנושיות שנעשו לטקסטים אחרי שנוצרו על ידי המודל.

מתאים ל

  • אימון מודל לסיכומי סבון

    התאמת מודל שפה לייצור סיכום רפואי מובנה ישירות מתוך טקסט של דיאלוג קליני.

  • פיתוח צ'אטבוטים רפואיים

    שימוש בפורמט צ'אט אמ אל כדי ללמד מודלים לנהל דיאלוג מדמה רופא ומטופל.

  • הערכת מודלי תיעוד

    בדיקת איכות של מערכות תיעוד אוטומטיות מול מאתיים וחמישים דוגמאות הבדיקה.

איפה זה נופל

כל השיחות והסיכומים כאן הם סינתטיים לחלוטין ויוצרו באמצעות מודל שפה. המפרסמים מדגישים בעצמם שהתוכן לא מיועד לשימוש קליני ישיר בלי מנגנוני הגנה ובדיקות תקינות. הטקסט כולו באנגלית ומבוסס על סגנון הכתיבה של מאמרים מדעיים, כך שהוא מפספס את העברית, את שפת היומיום של מטופלים אמיתיים ואת הבלאגן הרגיל בשיחה חיה.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא באופן אוטומטי. למרות שאומי מאשרת שימוש מסחרי מצידה, היא דורשת במפורש קבלת אישור מיוצרי מאגר נוט צ'ט המקורי. בנוסף לכך הרישיון הכללי בעמוד לא הוגדר, ולכן אי אפשר להתחיל בפיתוח מסחרי בלי בדיקה משפטית ופנייה למחברים.

האם יש במאגר שיחות בעברית?

אין במאגר עברית בכלל. כל הדיאלוגים מבוססים על ספרות רפואית באנגלית מפרויקט פאבמד סנטרל ונוצרו באנגלית על ידי מודל שפה. אם אתם בונים מערכת למרפאות בישראל, תצטרכו לתרגם את החומר או לאסוף שיחות מקומיות.

איך הנתונים נאספו ונבנו?

הבסיס הוא דוחות מקרה מתוך פאבמד סנטרל שנלקחו מפרויקט נוט צ'ט. על גבי המידע הזה, החוקרים הפעילו את ג'יפיטי 4 כדי לסנתז שיחות מטופל וקלינאי ולהפיק מהן סיכומי סבון מותאמים. אין כאן הקלטות או תמלולים מרופאים ומטופלים אמיתיים בשר ודם.

איך טוענים

הנתונים מחולקים ישירות לשלושה קובצי ג'ייסון בשם טריין, ולידיישן וטסט, לצד קובץ רידמי. אפשר לטעון אותם דרך ספריית דאטהסטס או ישירות כקובצי טקסט מובנים בלי צורך באישור גישה ידני או מילוי טפסים מוקדם בעמוד המאגר.

כל שורה בקבצים מחזיקה את עמודות השיחה, הסיכום והפרומפט, לצד עמודת צ'אט אמ אל שחוסכת זמן ומאפשרת להזין את השיחות ישר למודלים שמצפים לפורמט הזה. לפני שרצים לאמן, צריך לזכור שהנתונים מגיעים כטקסט בלבד ללא הקלטות קוליות תואמות.

from datasets import load_dataset

ds = load_dataset("omi-health/medical-dialogue-to-soap-summary")

הרישיון

הרישיון הרשמי מוגדר כלא דווח. לפי תנאי הגישה בכרטיס, חברת אומי מתירה כל שימוש, כולל מסחרי, אבל מתנה זאת בקבלת אישור מפורש מיוצרי המאגר המקורי נוט צ'ט. במצב כזה, אימון מודל מסחרי חושף אתכם לסיכון משפטי עד שתסדירו אישור ישיר מול החוקרים של הפרויקט המקורי.

הרישיון המלא ב־Hugging Face ↗