GPT
S

stanford-deidentifier-base

קוד פתוח

StanfordAIMImit2022-06-16

  • transformers
  • pytorch
  • bert
  • token-classification
  • sequence-tagger-model

מודל ייעודי להסרת פרטים מזהים מטקסטים רפואיים ודוחות רדיולוגיה באנגלית. הוא מומלץ על ידי החוקרים של סטנפורד לשימוש מעשי כחלופה קלה למודלי ענק.

  • 512טוקנים בהקשר
  • 418 MBמשקל הקבצים
  • 1,841,366הורדות בחודש
  • 85לייקים

מה זה

מדובר במודל לסיווג טוקנים שנועד לאתר ולמחוק מידע מזהה מדוחות רפואיים, בעיקר בתחום הדימות והרדיולוגיה. החוקרים אימנו אותו על מגוון מסמכים ביו-רפואיים כדי להגיע לרמת דיוק שתספיק למערכות אמיתיות, והם מציינים שמשקולות המודל האלו הן המומלצות ביותר מבין הגרסאות שהם שחררו.

במקום להשתמש במודל שפה כללי עצום שמנחש ישויות, מקבלים כאן כלי ממוקד של 12 שכבות שמכוון ישירות לשפה הקלינית. הנתונים מראים קרוב לשני מיליון הורדות, מה שמעיד שהוא הפך לברירת מחדל אצל צוותים שצריכים להכשיר טקסט רפואי למחקר בלי לשבור את הראש.

מתאים ל

  • אנונימיזציה של דוחות דימות

    מחיקת שמות מטופלים ומספרי תיק מפענוחי רנטגן ו־CT באנגלית לצורכי מחקר.

  • עיבוד פנימי ברשת מאובטחת

    הרצה מקומית על שרתי בית חולים בלי לשלוח טקסטים רפואיים לשירותי ענן חיצוניים.

  • הכנת דאטה סט לבינה מלאכותית

    ניקוי פרטים אישיים מאלפי מסמכים קליניים לפני אימון מודלים חדשים.

איפה זה נופל

הבעיה המרכזית שלו היא השפה. המודל תומך באנגלית בלבד, ואם תנסו להריץ אותו על סיכומי מחלה ישראליים בעברית הוא פשוט לא יעבוד. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים, מה שמחייב אתכם לחתוך מסמכים ארוכים לפסקאות קצרות לפני הניתוח.

הכרטיס גם לא מציג ציוני דיוק מדויקים או פירוט על סוגי הישויות הספציפיים שנלמדו. כשמדובר בפרטיות רפואית, פספוס אחד של שם או מזהה הוא קריטי, ולכן חובה לבדוק אותו על מדגם פנימי שלכם לפני שמסתמכים עליו.

שאלות
נפוצות

האם המודל יצליח לזהות פרטים מזהים בטקסט רפואי שנכתב בעברית?

לא. המודל אומן על אנגלית בלבד ומסתמך על תבניות של טקסט ביו-רפואי באנגלית. אם הטקסט כולל עברית או שילוב של מונחים בעברית, הוא יפספס ישויות ולא יבצע את העבודה.

איך מתמודדים עם דוחות רפואיים שארוכים מ־512 טוקנים?

צריך לפרק את הטקסט למקטעים קטנים או למשפטים לפני שמעבירים אותם למודל. לאחר הזיהוי וההסרה של הישויות בכל מקטע בנפרד, מחברים את הטקסט הנקי בחזרה למסמך המלא.

איך מריצים

המודל שוקל 418 מגה-בייט בלבד, כך שלא צריך שרת מפלצתי. כל מחשב פיתוח בסיסי או מעבד גרפי פשוט יריצו אותו בלי מאמץ באמצעות transformers, ואפילו הרצה על מעבד רגיל תהיה מהירה מספיק לכמויות קטנות של דוחות.

בגלל המשקל הנמוך, אין שום היגיון לשלם על קריאות API חיצוניות אם יש לכם צורך בעיבוד מקומי. הרצה עצמית כאן שומרת על המידע הרפואי בתוך הרשת שלכם, בלי להוציא נתונים רגישים החוצה.

from transformers import pipeline

pipe = pipeline("token-classification", model="StanfordAIMI/stanford-deidentifier-base")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 418 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון MIT. המשמעות פשוטה: מותר להשתמש בו לכל מטרה, כולל מוצרים מסחריים וקוד סגור, בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗