GPT
B

BiomedNLP-BiomedBERT-base-uncased-abstract

קוד פתוח

microsoftmit2022-03-02

  • transformers
  • pytorch
  • jax
  • bert
  • fill-mask

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

במקום לקחת מודל כללי ולהמשיך לאמן אותו, אימנו אותו מאפס רק על תקצירי מאמרים רפואיים. הוא מיועד למי שצריך מודל קומפקטי שמבין מונחים ביו-רפואיים באנגלית ולא מגמגם בזיהוי ישויות.

  • 512טוקנים בהקשר
  • 838 MBמשקל הקבצים
  • 1,271,789הורדות בחודש
  • 96לייקים

מה זה

המודל הזה, שנקרא בעבר PubMedBERT, נבנה על ארכיטקטורת BERT קלאסית עם 12 שכבות. ההבדל הגדול בינו לבין מודלים אחרים בגודל הזה הוא הדאטה. במקום להתחיל מ־BERT רגיל שאומן על ויקיפדיה וספרים ואז לכוונן אותו למונחים רפואיים, מיקרוסופט אימנו אותו מהיסוד על תקצירים מתוך מאגר PubMed. לפי החוקרים, אימון ייעודי מאפס בתחום הרפואי מביא תוצאות עדיפות על פני אימון המשך.

בפועל הוא מיועד למשימות של fill-mask, כלומר השלמת מילים מוסתרות בטקסט רפואי, או כבסיס מצוין ל־fine-tuning עבור סיווג טקסט, זיהוי ישויות קליניות או מענה לשאלות מתוך מחקרים. הוא השיג ביצועים מובילים במבחן BLURB, שבודק הבנה והסקה בטקסטים ביו-רפואיים, כך שהאוצר מילים והייצוגים שלו מכירים שמות של תרופות, גנים ומחלות הרבה יותר טוב ממודל כללי.

מתאים ל

  • חילוץ ישויות רפואיות

    מכיר שמות של תרופות וגנים ברמת הטוקנייזר כי אומן מאפס על ספרות מדעית.

  • סיווג מחקרים ותקצירים

    מצטיין בהבנת הקשר ביו-רפואי קצר עד 512 טוקנים ומאפשר fine-tuning זול.

  • השלמת טקסט במאגרים מדעיים

    מתאים למשימת fill-mask להשלמת מושגים טכניים חסרים בתוך טקסטים קליניים.

איפה זה נופל

המודל אומן אך ורק על תקצירים באנגלית מתוך PubMed. הוא לא ראה מאמרים מלאים, לא מבין עברית בכלל, ומחוץ לעולם הביו-רפואי הוא לא ייתן שום ערך מיוחד. בנוסף, חלון ההקשר שלו מוגבל ל־512 טוקנים, כך שאי אפשר להזין לו תיקים רפואיים ארוכים או מסמכים שלמים במכה אחת בלי לחתוך או לפצל אותם מראש.

שאלות
נפוצות

האם המודל הזה תומך בטקסטים רפואיים בעברית?

לא. המודל אומן אך ורק על מאגר תקצירים באנגלית, ואוצר המילים שלו לא כולל עברית. אם תזינו לו טקסט רפואי מקומי, הוא פשוט יישבר על הטוקניזציה.

מה ההבדל בינו לבין מודלים כמו BioBERT?

BioBERT לקח מודל BERT כללי והמשיך את האימון שלו על טקסט רפואי. המודל הזה אומן מאפס לחלוטין על תקצירי PubMed, מה שנותן לו אוצר מילים מדויק יותר לתחום הביולוגי והרפואי.

איך מריצים

במשקל כולל של כ־838 מגה-בייט, לא צריך חומרה מיוחדת כדי לעבוד איתו. אפשר לטעון אותו ישירות דרך ספריית transformers בתוך שניות, והוא רץ בקלות על כל מעבד מודרני בלי לחנוק את הזיכרון, אם כי להסקה מהירה במיוחד או לאימון נוסף כרטיס מסך בסיסי יעשה את העבודה תוך רגעים ספורים.

אין שום סיבה אמיתית לשלם על API חיצוני כשמדובר במודל כל כך קל וקטן. אתם פשוט מורידים את הקבצים, מריצים לוקאלית על השרת שלכם ושומרים על פרטיות מלאה של המידע הרפואי.

from transformers import pipeline

pipe = pipeline("fill-mask", model="microsoft/BiomedNLP-BiomedBERT-base-uncased-abstract")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 838 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT. מותר להשתמש בו לכל מטרה, כולל מסחרית לגמרי, לשנות את המשקלים ולשלב אותו במוצר סגור, בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗