GPT
C

Clinical-Longformer

קוד פתוח

yikuan8רישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • longformer
  • fill-mask
  • clinical

התאמה קלינית של מודל שפה לטקסטים ארוכים במיוחד. הוא מיועד למי שצריך לעבד סיכומי מחלה שלמים באנגלית בלי לחתוך את המסמך באמצע.

  • 4,098טוקנים בהקשר
  • 570 MBמשקל הקבצים
  • 527,365הורדות בחודש
  • 69לייקים

מה זה

בסיס המודל נשען על ארכיטקטורת Longformer שעברה אימון המשך על רשומות רפואיות ממאגר MIMIC-III. במקום לחתוך דוחות אשפוז לאורכים קצרים שמתאימים למודלים רגילים, הוא מקבל קלט של מעל 4,000 טוקנים בבת אחת. המשימה המקורית שלו היא השלמת מילים מוסתרות, אך המטרה האמיתית היא לשמש כבסיס למשימות סיווג, זיהוי ישויות קליניות ומענה על שאלות מתוך תיקים רפואיים.

בבדיקות מול ClinicalBERT בעשרה מאגרי מידע שונים, הוא עקף אותו לפחות בשני אחוזים בכל משימה. הפער הזה נובע בעיקר מהיכולת לחבר הקשר בין פסקאות מרוחקות ברשומה אחת, דבר שמודלים מוגבלים בדרך כלל מפספסים לחלוטין. הוא פועל רק על אנגלית קלינית ומשמר את אוצר המילים והמונחים האופייניים לרופאים.

מתאים ל

  • חילוץ ישויות מדוחות רפואיים

    זיהוי תרופות, מינונים ואבחנות בתוך סיכומי מחלה ארוכים בלי לאבד את ההקשר של תחילת המסמך.

  • סיווג רשומות קליניות

    שיוך תיקים רפואיים לקטגוריות אבחון על סמך כל המידע שנאסף באשפוז ולא רק לפי תקציר.

  • השלמת מושגים בטקסט רפואי

    ניתוח מונחים קליניים מוסתרים בתוך משפטים של רופאים באנגלית כחלק ממחקר או ניקוי דאטה.

איפה זה נופל

הוא אומן אך ורק באנגלית ועל רשומות רפואיות מערביות, כך שאין לו שום הבנה בעברית או במינוח מקומי. בנוסף, מדובר במודל השלמת טקסט ולא במודל שיחה שמייצר תשובות חופשיות. אם תנסו לתשאל אותו ישירות בלי לאמן עליו שכבת סיווג או חילוץ מידע, לא תקבלו תוצאה שימושית. אתם חייבים לבצע התאמה למשימה הספציפית שלכם לפני שתוכלו לחבר אותו למוצר.

שאלות
נפוצות

האם אפשר להשתמש בו כדי לעבד סיכומי אשפוז מרופאים בישראל?

רק אם הסיכומים כתובים באנגלית. המודל אומן על שפה זו בלבד ואינו מזהה עברית כלל, כך שכל טקסט מקומי ידרוש תרגום מוקדם או מודל ייעודי אחר.

האם המודל יודע לענות לשאלות של משתמשים כמו צ׳אט?

לא. מדובר במודל מסוג Masked LM שמנחש מילים מוסתרות ונועד לחילוץ מידע או לסיווג, ולא במודל יוצר טקסט שמסוגל לנהל שיחה חופשית.

איך מריצים

המשקל הכולל של הקבצים עומד על 570 מגה בייט, מה שהופך אותו לקל מאוד להורדה ולתפעול מקומי. טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות פקודות AutoModelForMaskedLM ו־AutoTokenizer פשוטות, ללא צורך בהגדרות תשתית מורכבות.

מבחינת חומרה, כרטיס גרפי פשוט עם מעט זיכרון יריץ אותו בקלות, ואין שום צורך לפנות לשרתי API חיצוניים בתשלום. אם המטרה היא לאמן אותו הלאה על נתונים פנימיים משלכם, תצטרכו קצת יותר זיכרון בגלל אורך הקלט, אבל עבור הרצה ושימוש ישיר מדובר בחומרה סטנדרטית לחלוטין.

from transformers import pipeline

pipe = pipeline("fill-mask", model="yikuan8/Clinical-Longformer")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 570 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצר לא ציין שום רישיון שימוש בעמוד המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בו במוצר מסחרי, גם אם הקבצים פתוחים להורדה. בנוסף, הוא אומן על נתוני MIMIC-III שכפופים להסכמי שימוש מחמירים בעולם המחקר. אם אתם בונים מערכת מסחרית, כדאי לברר ישירות מול המפרסם מה הסטטוס המשפטי של המשקלים.

הרישיון המלא בעמוד המודל ↗