GPT
B

BioMedLM

קוד פתוח

stanford-crfmbigscience-bloom-rail-1.02022-12-14

  • transformers
  • pytorch
  • gpt2
  • text-generation
  • text-generation-inference

מודל שפה קומפקטי שאומן מאפס רק על מאמרים ותקצירים רפואיים ממאגר פאבמד. הוא מתאים למי שרוצה בסיס ייעודי למשימות עיבוד שפה ביו-רפואיות בלי לשלם על מודלי ענק.

  • 1,024טוקנים בהקשר
  • 10.0 GBמשקל הקבצים
  • 1,144הורדות בחודש
  • 458לייקים

מה זה

מדובר במודל של 2.7 מיליארד פרמטרים בארכיטקטורת GPT-2, שפותח במשותף על ידי Stanford CRFM וחברת MosaicML ונקרא במקור PubMedGPT. במקום לקחת מודל כללי ולאמן אותו קצת על טקסט מדעי, אימנו אותו מראש על 300 מיליארד טוקנים של ספרות רפואית בלבד מתוך The Pile. ההבדל הגדול מתחיל כבר בטוקנייזר, שנבנה במיוחד עבור השפה הזו ומזהה מונחים ביולוגיים ורפואיים מורכבים כמילה אחת ולא כשברירי הברות חסרי משמעות.

הגישה הזו נותנת תוצאות חזקות במשימות ייעודיות לתחום, כולל ציון של 50.3% דיוק במבחן שאלות ותשובות MedQA. זה אולי נשמע נמוך ביחס למבחני שפה כלליים, אבל בעולם הרפואי זה היה הישג מוביל למודל בגודל כזה. המטרה המרכזית שלו היא לשמש כבסיס לכיול נוסף ולא כצ'אטבוט שעונה ישירות לחולים.

מתאים ל

  • מענה לשאלות ברפואה

    המודל מציג ביצועים גבוהים במענה על שאלות מדעיות ומבחני MedQA לאחר כיול ייעודי.

  • סיווג ותיוג תקצירים

    הטוקנייזר מזהה מונחים ביולוגיים שלמים, מה שמשפר חילוץ ישויות וסיווג מידע מדעי.

  • בסיס למחקר ביו-רפואי

    הוא מתאים כמשקולות בסיס לאימון מודלים פנימיים בארגוני מחקר שאינם מוציאים מידע החוצה.

איפה זה נופל

חלון ההקשר קצר מאוד ועומד על 1,024 טוקנים בלבד, מה שמקשה על ניתוח מאמרים שלמים ברצף ומחייב חיתוך אגרסיבי של טקסטים ארוכים. המפתחים מזהירים מפורשות שהמודל לא מתאים ליצירת טקסט חופשי בסביבת ייצור, ומיועד למחקר או כבסיס לכוונון בלבד. כמו כן, הטקסטים שהוא פולט עלולים להכיל הטיות, סטריאוטיפים וטעויות עובדתיות, נושא מסוכן במיוחד בהקשרים של בריאות.

שאלות
נפוצות

האם המודל מבין עברית?

לא. המודל אומן כולו על ספרות ומאמרים רפואיים באנגלית מתוך מאגר The Pile, וטוקנייזר שלו מותאם ספציפית למונחים באנגלית. ניסיון להזין לו טקסט רפואי בעברית יניב תוצאות שבורות ולא מדויקות.

האם כדאי להשתמש בו ישירות לצ'אט עם משתמשים?

ממש לא. המפתחים מבהירים שאיכות יצירת הטקסט נבדקה בעיקר לצורכי מחקר ואינה מתאימה למוצר חי. בנוסף, רישיון השימוש אוסר מתן עצות רפואיות ישירות, ולכן השימוש הנכון הוא משימות ניתוח מידע או כיול נוסף בלבד.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־10 גיגה-בייט בגלל ייצוג float32. כדי להריץ אותו בהיסק מקומי בצורה נוחה, תצטרכו כרטיס מסך עם לפחות 12 עד 16 גיגה זיכרון, או להמיר אותו לדיוק נמוך יותר כמו float16 שיחתוך את דרישת הזיכרון בחצי. הקוד עצמו נשען על ספריית transformers סטנדרטית, כך שאין צורך בכלים מיוחדים כדי לטעון אותו.

אם כל מה שאתם צריכים זה לסווג כמה מאמרים פעם בשבוע, כנראה שחבל על ההתעסקות בהקמת שרת ייעודי ועדיף לפנות למודל גדול יותר דרך API. מצד שני, אם אתם עובדים על דאטה רגיש של מחקר שלא יכול לצאת מהתשתית המקומית, הגודל שלו מאפשר אירוח עצמי פשוט וזול יחסית.

from transformers import pipeline

pipe = pipeline("text-generation", model="stanford-crfm/BioMedLM")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 10.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא bigscience-bloom-rail-1.0. הוא מתיר שימוש פתוח ומחקר, אך כולל הגבלות שימוש נוקשות מאוד בתחום הרפואי. נאסר במפורש להשתמש במודל או בנגזרות שלו לצורך מתן ייעוץ רפואי או פענוח של תוצאות בדיקות רפואיות, כך שאי אפשר להטמיע אותו במוצר שמחליף החלטה קלינית.

הרישיון המלא בעמוד המודל ↗