GPT
B

BiomedNLP-BiomedBERT-base-uncased-abstract-fulltext

קוד פתוח

microsoftmit2022-03-02

  • transformers
  • pytorch
  • jax
  • bert
  • fill-mask

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

זה מודל שפה שנבנה מאפס על מאמרים רפואיים, במקום לקחת מודל כללי ולהלביש עליו מינוח מקצועי. הוא מיועד למי שצריך דיוק גבוה בטקסטים ביו-רפואיים.

  • 512טוקנים בהקשר
  • 838 MBמשקל הקבצים
  • 220,044הורדות בחודש
  • 335לייקים

מה זה

מיקרוסופט קראו לו פעם PubMedBERT, והרעיון מאחוריו שונה מרוב מה שמסתובב בחוץ. במקום לקחת מודל BERT סטנדרטי שאומן על ויקיפדיה ולהמשיך לאמן אותו על רפואה, הם אימנו אותו מאפס לגמרי על תקצירים מ־PubMed ומאמרים מלאים מ־PubMedCentral. זה משפיע ישירות על אוצר המילים ועל האופן שבו המודל מבין מונחים קליניים מורכבים.

לפי המפתחים, הגישה הזו הביאה אותו למקום הראשון במבחן הביצועים BLURB, שמודד הבנה והסקה בטקסטים רפואיים. במילים פשוטות, הוא מתמודד עם שמות של תרופות, גנים ותהליכים ביולוגיים בלי להישבר על טוקניזציה עקומה שמאפיינת מודלים כלליים.

מתאים ל

  • זיהוי ישויות ביו-רפואיות

    אימון שכבת סיווג עליונה לחילוץ שמות של מחלות, גנים ותרופות מתוך טקסטים קליניים.

  • השלמת מונחים במאמרים

    ניבוי מילים חסרות בטקסט רפואי באנגלית בזכות משימת fill-mask המקורית שעליה אומן.

  • סיווג מסמכים רפואיים

    שימוש בייצוגי הטקסט כדי למיין תקצירים מדעיים לפי תחומים או סוגי ניסויים.

איפה זה נופל

הוא מוגבל לחלון של 512 טוקנים, ולכן אי אפשר להזין לתוכו מאמרים שלמים ברצף אלא רק פסקאות או תקצירים. המשימה המקורית שלו היא fill-mask באנגלית בלבד, ואין לו מושג בעברית. בנוסף, הוא לא מודל שיחה שפולט תשובות מוכנות, תצטרכו להוסיף שכבת אימון ייעודית כדי להפוך אותו למסווג או לחלץ ממנו ישויות.

שאלות
נפוצות

האם המודל מבין עברית?

לא. המודל אומן אך ורק על מאגרים באנגלית מ־PubMed ו־PubMedCentral, ואוצר המילים שלו uncased מותאם לשפה הזו בלבד. כל ניסיון להזין לו טקסט רפואי בעברית ייכשל.

אפשר להשתמש בו כצ'אטבוט רפואי?

ממש לא. מדובר במודל מסוג BertForMaskedLM שמיועד להבנת שפה והשלמת טוקנים חסרים, לא במודל יוצר כמו GPT. כדי לענות על שאלות צריך לחבר אותו למערכת ייעודית או להשתמש בו כבסיס לחילוץ מידע.

למה להעדיף אותו על פני BERT רגיל?

בגלל שהוא אומן מאפס על ספרות רפואית במקום לעבור התאמה משנית. המבנה הפנימי ואוצר המילים שלו מותאמים ישירות למונחים מדעיים, מה שנותן לו תוצאות גבוהות יותר במשימות ביו-רפואיות.

איך מריצים

המודל שוקל 838 מגה-בייט ורץ ישירות דרך ספריית transformers בפייתון. מדובר בארכיטקטורת BERT קלאסית עם 12 שכבות, מה שאומר שלא צריך חומרה מיוחדת כדי להריץ אותו. מעבד רגיל יספיק לניסויים והסקה בסיסית, וכל כרטיס מסך פשוט יחזיק אותו בקלות בזיכרון.

אין שום סיבה לשלם על API חיצוני בשביל גודל כזה. הוא קטן מספיק כדי לשבת בתוך הקונטיינר שלכם, לעבוד מקומית ולשמור על פרטיות המידע, שזה שיקול קריטי בעבודה עם נתונים רפואיים.

from transformers import pipeline

pipe = pipeline("fill-mask", model="microsoft/BiomedNLP-BiomedBERT-base-uncased-abstract-fulltext")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 838 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון MIT פתוח ומתירני לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו ולשלב אותו במוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים המקורית של מיקרוסופט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗