GPT
B

BioLinkBERT-base

קוד פתוח

michiyasunagaapache-2.02022-03-08

  • transformers
  • pytorch
  • bert
  • feature-extraction
  • exbert

גרסת BERT מבוססת PubMed שמאומנת ספציפית על קישורי ציטוטים בין מאמרים. היא מיועדת למי שצריך לחלץ ידע רפואי ולחבר עובדות שמתפרסות על פני כמה מקורות שונים באנגלית.

  • 512טוקנים בהקשר
  • 414 MBמשקל הקבצים
  • 14,128הורדות בחודש
  • 45לייקים

מה זה

מדובר באנקודר של 12 שכבות שמחליף ישירות את BERT הרגיל במשימות של סיווג, שליפת מאפיינים ומענה לשאלות ביו-רפואיות. ההבדל המרכזי מול מודלים רגילים הוא תהליך האימון המקדים, שבמקום לקרוא כל מאמר בנפרד, הזין למודל מקטעים ממאמרים שמצטטים זה את זה בתוך אותו חלון טקסט.

התוצאה של החיבור הזה מורגשת במבחנים שמערבים כמה מסמכים יחד. בבנצ'מרק PubMedQA הוא מגיע לציון של 70.2 לעומת 55.8 של PubmedBERT-base, ובמדד BLURB הכללי הוא מגיע ל־83.39 מול 81.10. זה שיפור מוחשי מאוד במשימות שדורשות הבנה של קשרים והקשרים בין תכנים רפואיים, ולא רק זיהוי מילים בודדות.

מתאים ל

  • סיווג תקצירים רפואיים

    מיון מאמרי PubMed לפי נושאים, תוך ניצול ההבנה של ציטוטים ומושגים מקצועיים.

  • מענה לשאלות מדעיות

    שליפת תשובות מתוך מאגרי ידע ביו-רפואיים שבהם המידע מפוזר בכמה מקורות.

  • חילוץ וקטורים למחקר

    הפקת אמבדינגס לטקסט רפואי לצורך חיפוש סמנטי והשוואת מסמכים מדעיים.

איפה זה נופל

המודל מוגבל לחלון של 512 טוקנים, ולכן אי אפשר להכניס אליו מאמרים שלמים, אלא רק תקצירים או פסקאות נבחרות. בנוסף, הוא אומן רק על אנגלית מתוך מאגרי PubMed. אם תנסו לנתח איתו סיכומי מחלה בעברית או טקסטים קליניים שנכתבו בשפה חופשית מחוץ לעולם המחקר האקדמי, הוא יאבד את רוב היתרון שלו.

שאלות
נפוצות

האם המודל מתאים לעיבוד טקסטים רפואיים בעברית?

לא. המודל אומן על טקסטים באנגלית בלבד מתוך PubMed. לטקסטים בעברית תצטרכו לחפש מודל שאומן על עברית או לאמן מודל כזה בעצמכם.

אפשר להשתמש בו ישירות בלי fine-tuning?

אפשר להשתמש בו לחילוץ אמבדינגס, אבל למשימות כמו סיווג או מענה לשאלות צריך לאמן אותו על הנתונים הספציפיים שלכם. הוא בסיס מצוין להתאמה, לא מוצר מוגמר.

איך מריצים

המודל שוקל 414 מגה-בייט בלבד, כך שלא צריך שרת מפלצתי בשביל להריץ אותו. אפשר להעלות אותו עם ספריית transformers ישירות על מעבד מקומי רגיל או על כרטיס מסך בסיסי וזול בלי בעיה של זיכרון.

אין שום סיבה לשלם ל־API חיצוני על משקל כזה, אלא אם אתם מריצים מיליוני בקשות בשנייה ואין לכם כוח לנהל שרתים. אם אתם צריכים ביצועים גבוהים יותר ויש לכם עוד משאבים, קיימת גם גרסת large שמשיגה 84.30 במדד BLURB, אבל גרסת ה־base הקטנה הזו תספיק לרוב השימושים השוטפים.

from transformers import pipeline

pipe = pipeline("text-classification", model="michiyasunaga/BioLinkBERT-base")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 414 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקולות, ולשלב אותו במוצר שלכם, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗