GPT
C

ClinicalBERT

קוד פתוח

medicalaiרישיון לא דווח2023-03-19

  • transformers
  • pytorch
  • distilbert
  • fill-mask
  • medical

המודל הזה אומן על מיליוני רשומות רפואיות ומנחש מילים חסרות בטקסט קליני. הוא מתאים למי שבונה סיווג או חילוץ מידע מתיקים רפואיים באנגלית וצריך בסיס שמכיר מונחים מקצועיים.

  • 512טוקנים בהקשר
  • 518 MBמשקל הקבצים
  • 29,401הורדות בחודש
  • 379לייקים

מה זה

מדובר במודל שמבוסס על ארכיטקטורת DistilBert ולמד שפה דרך משימת השלמת מילים מוסתרות בטקסטים רפואיים. במקום להשתמש במודל שפה כללי שלא מכיר מושגים קליניים, המפתחים אימנו אותו על קורפוס של 1.2 מיליארד מילים ממגוון מחלות, ואחר כך ביצעו אימון נוסף על תיקים רפואיים של יותר משלושה מיליון מטופלים ממרכזים שונים.

בניגוד למודלי ענק מודרניים שמייצרים שיחה, זהו מקודד קומפקטי שמיועד להבין מבנה של משפט רפואי ולייצר לו ייצוג וקטורי. המשקל של הקבצים עומד על כחצי ג'יגה בייט בלבד, כך שמקבלים הבנה של מונחי רפואה ומחלות בלי לסחוב משקלים כבדים של מודלים גנרטיביים. הוא מיועד לשמש בסיס למשימות עיבוד שפה במערכות קליניות, בעיקר חיזוי מונחים או כבסיס לכוונון נוסף על משימות סיווג.

מתאים ל

  • השלמת מונחים בטקסט רפואי

    הוא אומן לנחש מילים מוסתרות מתוך הקשר של תיקים קליניים ומכיר שמות מחלות.

  • חילוץ ייצוגים למידע קליני

    מייצר וקטורים מתוך טקסט רפואי באנגלית כבסיס למודלי סיווג קלים.

  • עיבוד רשומות מקומי ללא ענן

    שוקל רק 518 מגה בייט ומאפשר לנתח נתונים חסויים על חומרה מקומית פשוטה.

איפה זה נופל

הוא לא מודל שיחה ולא מייצר תשובות ארוכות למטופלים, אלא רק מנחש מילים חסרות או מחזיר וקטורים. האימון המקורי התבצע עם אורך רצף מקסימלי של 256 טוקנים בלבד, למרות שחלון ההקשר עומד על 512, כך שהוא לא מתאים למסמכים ארוכים בלי לחתוך אותם. בנוסף, הדאטהסט מבוסס על אנגלית, אז אין מה לבנות עליו לעיבוד תיקים רפואיים בעברית. לפני שמכניסים אותו למערכת אמת צריך לזכור שאין בכרטיס שום נתוני בדיקה או מדדי דיוק, ולכן חובה לבצע הערכה עצמאית מול הנתונים שלכם.

שאלות
נפוצות

האם המודל מבין תיקים רפואיים בעברית?

לא. המודל אומן על קורפוס באנגלית של מיליארד מילים ורשומות רפואיות, והוא לא יתפקד בצורה סבירה על טקסט קליני בעברית.

האם אפשר להשתמש בו כמו צ'אטבוט רפואי?

ממש לא. מדובר במודל שמנחש מילים חסרות ולא במודל שמייצר תשובות לשאלות, ולכן הוא מתאים רק לעיבוד שפה פנימי ולמשימות תשתית.

האם המודל ירוץ מהר על שרת רגיל בלי מעבד גרפי?

כן, המודל מבוסס על ארכיטקטורה קלה ומשקלו הכולל קטן, ולכן הוא מסוגל לעבד טקסטים בזמן קצר גם על גבי מעבד רגיל.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון עם AutoTokenizer ו־AutoModel. בגלל שמדובר בארכיטקטורת DistilBert עם קבצים במשקל 518 מגה בייט, אתם ממש לא צריכים שרת יקר או מעבדים גרפיים כבדים. הוא רץ בלי בעיה על מעבד רגיל של מחשב נייד או על שרת ענן פשוט וזול.

אין פה גרסאות שונות לבחור מתוכן ואין סיבה להסתמך על שירותי צד שלישי או לשלם על קריאות חיצוניות. זה בדיוק סוג המודל שמריצים מקומית ובתוך הרשת שלכם, במיוחד כשעובדים עם מידע רפואי רגיש שלא רוצים להוציא החוצה.

from transformers import pipeline

pipe = pipeline("fill-mask", model="medicalai/ClinicalBERT")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 518 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא ציינו רישיון בעמוד המודל. מבחינה מעשית ומשפטית, זה אומר שאין לכם אישור מפורש להשתמש בו במוצר מסחרי, וחברות עם בדיקות תאימות קפדניות לא יאפשרו להכניס אותו לקוד שלהן בלי לפנות לצוות שפרסם אותו ולקבל הבהרה.

הרישיון המלא בעמוד המודל ↗