GPT
B

BioLinkBERT-large

קוד פתוח

michiyasunagaapache-2.02022-03-08

  • transformers
  • pytorch
  • bert
  • feature-extraction
  • exbert

גרסה מוגדלת של ברט שאומנה על מאמרי פובמד תוך שימוש בקישורי ציטוט ביניהם. מי שצריך סיווג, מענה לשאלות או שליפת מידע בטקסטים רפואיים באנגלית יקבל פה דיוק גבוה מברט רגיל.

  • 512טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 52,493הורדות בחודש
  • 45לייקים

מה זה

במקום לדחוף למודל קטעי טקסט בודדים ומנותקים, הכותבים הזינו לתוכו מאמרים שמצטטים זה את זה באותו חלון אימון. הרעיון פשוט: ידע רפואי אמיתי לא יושב בפסקה אחת אלא נבנה על פני כמה מקורות. המבנה הזה מחליף ישירות כל מודל מסוג ברט, אבל מבין טוב יותר קשרים מורכבים בין מסמכים שונים.

במבחנים התוצאות ברורות. הוא מגיע לציון 84.30 במדד בלרב ועוקף את פובמד-ברט הוותיק בכל משימה מדווחת, כולל פובמד-קיו-איי עם 72.2 מול 55.8, ומד-קיו-איי עם 44.6 מול 38.1. במבחן הרפואה של מדד אם-אם-אל-יו הוא עומד על 50.7 נקודות עם שלוש מאות וארבעים מיליון פרמטרים, מעל מודלים ענקיים כמו יוניפייד-קיו-איי עם 11 מיליארד פרמטרים וג'י-פי-טי 3 שהגיע שם ל־38.7.

מתאים ל

  • סיווג מסמכים רפואיים

    אימון שכבת סיווג עליונה למיון תקצירי מחקר לפי תחומים או תוצאות קליניות באנגלית.

  • חילוץ וקטורים לחיפוש

    יצירת ייצוג וקטורי איכותי ממונחים רפואיים עבור מנועי חיפוש ושליפת מאמרים קשורים.

  • מענה לשאלות קליניות

    כוונון עדין למערכות שבודקות ידע רפואי מול שאלונים מבוססי ספרות מדעית.

איפה זה נופל

זה מודל שמבין אנגלית בלבד ומבוסס אך ורק על מאמרים וציטוטים מפובמד. חלון ההקשר שלו מוגבל לחמש מאות ושנים עשר טוקנים, כך שאי אפשר להזין אליו מסמך רפואי מלא בלי לחתוך או לפצל אותו מראש. בנוסף, הוא אינו מודל שיוצר טקסט חופשי אלא אנקודר, כך שלפני שמשלבים אותו במוצר צריך לאמן עליו ראש ייעודי למשימה הספציפית שלכם.

שאלות
נפוצות

האם הוא מתאים לעבודה עם תיקים רפואיים בעברית?

לא. המודל אומן על אנגלית בלבד ומתוך מאמרים מדעיים. הוא לא יזהה עברית ולא יתמודד עם ניסוחים קליניים שנכתבו בשפה המקומית.

האם אפשר להשתמש בו כמו צ'אט שמייצר תשובות?

לא, זהו מודל מסוג ברט שמשמש כאנקודר. הוא מחזיר ייצוגים מתמטיים של הטקסט שמתאימים למשימות כמו סיווג או שליפה, ולא פולט טקסט חדש בעצמו.

איך מריצים

טוענים אותו ישירות דרך ספריית טרנספורמרס בפייתורץ' עם שתי שורות קוד של אוטו-מודל ואוטו-טוקנייזר. הקבצים שוקלים 1.2 גיגה-בייט, כך שהוא ירוץ בלי בעיה על כרטיס מסך בסיסי עם שמונה עד שישה עשר גיגה זיכרון לצורך הסקת מסקנות, וגם על מעבד רגיל אם השיהוי פחות קריטי.

אם אתם מתכננים כוונון עדין על המידע שלכם, תצטרכו כרטיס מסך חזק יותר כדי להתמודד עם עשרים וארבע השכבות של גרסת הלארג'. להריץ אותו עצמאית זול ופשוט בהרבה מתשלום פר קריאה לשירותים חיצוניים, בעיקר כשמדובר בסיווג טקסטים או חילוץ וקטורים בקצב גבוה.

from transformers import pipeline

pipe = pipeline("text-classification", model="michiyasunaga/BioLinkBERT-large")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון אפאצ'י 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקולות, ולשלב אותו במוצרים סגורים בלי לחשוף את הקוד שלכם, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗