GPT
G

gatortron-base

קוד פתוח

UFNLPapache-2.02023-06-02

  • transformers
  • pytorch
  • megatron-bert
  • endpoints_compatible

מודל שפה קליני מבוסס ארכיטקטורת BERT שמתמחה בטקסטים רפואיים מורכבים. הוא מתאים למי שצריך לעבד רשומות רפואיות באנגלית בלי להסתמך על מודלים כלליים שלא מכירים את הז'רגון.

  • 512טוקנים בהקשר
  • 680 MBמשקל הקבצים
  • 28,451הורדות בחודש
  • 66לייקים

מה זה

מדובר במודל של 345 מיליון פרמטרים שפותח בשיתוף פעולה בין אוניברסיטת פלורידה לבין אנבידיה. במקום להתבסס בעיקר על טקסטים מהאינטרנט, המפתחים אימנו אותו על מאגר עצום של מעל 90 מיליארד מילים, שרובן המוחלט כולל 82 מיליארד מילים של רישומים קליניים שעברו הסרת פרטים מזהים מבית החולים של פלורידה, יחד עם חומר ממאגרי פאבמד ומימיק 3.

בגודל הזה של מודלים מבוססי אנקודר, ההבדל העיקרי מול מודלים כלליים הוא החשיפה המאסיבית לתיעוד רפואי אמיתי. הוא מיועד למשימות כמו חילוץ ישויות רפואיות, זיהוי קשרים בין ממצאים וטיפולים, ומיפוי של גורמים חברתיים המשפיעים על הבריאות מתוך פסקאות של רופאים.

מתאים ל

  • חילוץ ישויות רפואיות

    זיהוי אוטומטי של מחלות, תרופות ומינונים מתוך סיכומי אשפוז קצרים באנגלית.

  • מיפוי גורמי בריאות חברתיים

    שליפת נתונים על הרגלי חיים ומצב סוציואקונומי מתוך הערות רופאים.

  • זיהוי קשרים קליניים

    הבנת הקשר התחבירי בין תסמינים לבין תוצאות בדיקות דימות ומעבדה.

איפה זה נופל

חלון ההקשר כאן מוגבל ל־512 טוקנים בלבד, מה שאומר שאי אפשר להזין אליו דוחות רפואיים ארוכים בלי לחתוך אותם קודם או להשתמש בגרסת ה־2k. בנוסף, המודל אומן כולו על אנגלית ממוסדות בארצות הברית, ולכן אין מה לבנות עליו לטקסטים בעברית או למונחים מקומיים של קופות חולים בארץ. לפני שמשלבים אותו במוצר, חובה לזכור שהוא עבר התאמה על נתונים שעברו תהליך החלפה של שמות ופרטים אישיים במחרוזות דמי, וצריך לבדוק איך הוא מגיב לשמות אמיתיים.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה עם תיקים רפואיים בעברית?

לא. המודל אומן על טקסטים באנגלית בלבד שמקורם במערכות בריאות ומחקרים אמריקאיים. אם תזינו לו טקסט בעברית תקבלו תוצאות חסרות משמעות.

מה ההבדל בינו לבין מודל גנרטיבי רגיל?

זהו מודל מסוג BERT שמיועד לייצוג טקסט, סיווג וחילוץ מידע, ולא מודל שמייצר תשובות בצ'אט. המטרה שלו היא לנתח משפטים קליניים קיימים ולהוציא מהם תובנות מדויקות.

מה עושים אם הטקסט הרפואי ארוך מ־512 טוקנים?

אפשר לפצל את המסמך לפסקאות ולהריץ כל אחת בנפרד, או לעבור ישירות לגרסת gatortron-base-2k שמאפשרת קלט של עד 2048 טוקנים באותה ארכיטקטורה.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers הרגילה בפייתון עם קריאה קצרה למודל ולטוקנייזר שלו. קבצי המשקלים שוקלים 680 מגה בייט בלבד, כך שלא צריך שרתים מנופחים כדי לעבוד איתו. כרטיס מסך בסיסי או אפילו מעבד חזק יספיקו כדי להריץ הסקה בלי צווארי בקבוק.

אם אתם צריכים לנתח מסמכים ארוכים יותר, יש בסדרה גם גרסת 2k שמרחיבה את חלון ההקשר, לצד גרסאות ענק של 3.9 ו־8.9 מיליארד פרמטרים. להרצה מקומית של משימות קלאסיות, עדיף להריץ את הגרסה הזו ישירות אצלכם במקום לשלם על קריאות רשת, בעיקר בגלל הרגישות של מידע רפואי.

from transformers import pipeline

pipe = pipeline("text-generation", model="UFNLP/gatortron-base")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 680 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצר, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗