GPT
M

medical_summarization

קוד פתוח

Falconsaiapache-2.02023-10-23

  • transformers
  • pytorch
  • coreml
  • safetensors
  • t5

מודל קטן מאוד לתמצות טקסטים רפואיים באנגלית שמבוסס על T5. הוא מתאים למי שחייב עיבוד מהיר ומקומי של פסקאות קצרות בלי להחזיק שרת יקר.

  • 61Mפרמטרים
  • 512טוקנים בהקשר
  • 760 MBמשקל הקבצים
  • 1,592הורדות בחודש

מה זה

מדובר במודל מסוג T5ForConditionalGeneration עם כ־61 מיליון פרמטרים, גודל זעיר שמקביל לגרסת T5-small. התפקיד היחיד שלו הוא לקבל טקסט רפואי ולהוציא סיכום קצר באנגלית. הקבצים שוקלים 760 מגה־בייט בדיוק של float32, מה שאומר שהוא שוקל מעט מאוד ורץ כמעט בכל מקום.

היתרון שלו הוא המיקוד בתחום הקליני והמחקרי לצד משקל נוצה. מודלים כלליים בגודל כזה מתקשים לתפוס מונחים מקצועיים כמו שמות תרופות, מכשור רפואי או פרוצדורות. הדוגמה הרשמית שלו מראה שהוא מיועד לקרוא תיאורי מקרים ומחקרים, למשל סריקות MRI בחולים עם קוצבי לב, ולחלץ מהם את השורה התחתונה.

מתאים ל

  • תמצות מאמרים קצרים

    חילוץ המסקנות המרכזיות מתקצירי מחקרים רפואיים באנגלית עד 512 טוקנים.

  • סיכום ממצאי בדיקות

    עיבוד פסקאות של דוחות הדמיה קצרים לתוך סיכום תמציתי וממוקד.

  • עיבוד מקומי למניעת דליפה

    ריצה על שרת פנימי ללא גישה לרשת כדי לא להוציא נתוני מטופלים החוצה.

איפה זה נופל

המגבלה הכי קשה היא חלון הקשר של 512 טוקנים בלבד. אי אפשר להזין לו תיקים רפואיים שלמים או מאמרים מלאים, אלא רק תקצירים ופסקאות קצרות, אחרת הטקסט ייחתך. בנוסף, הוא תומך באנגלית בלבד ולא יבין עברית. במודל כזה קטן תמיד יש סיכון להשמטת פרטים קריטיים, ואי אפשר להסתמך עליו להחלטות קליניות בלי בדיקה אנושית.

שאלות
נפוצות

האם אפשר לתת לו לסכם סיכום מחלה שלם מבית חולים?

לא, חלון ההקשר מוגבל ל־512 טוקנים בלבד. סיכום אשפוז טיפוסי יעבור את המגבלה הזו בהרבה וייחתך באמצע. תצטרכו לפרק את המסמך לפסקאות בודדות או לחפש מודל עם חלון גדול יותר.

האם הוא יעבוד עם טקסטים רפואיים בעברית?

הוא אומן ומוגדר לשפה האנגלית בלבד. אם תזינו לו עברית תקבלו פלט משובש, חסר משמעות או ריק. הוא מתאים אך ורק לעבודה באנגלית.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון עם משימת summarization. בגלל הגודל שלו, כ־61 מיליון פרמטרים בלבד, לא צריך כרטיס מסך ייעודי כדי להגיע לזמני תגובה טובים. מעבד סביר של מחשב נייד או שרת ענן פשוט יריצו אותו בלי בעיה, והוא תופס פחות מגיגה בזיכרון.

אין פה גרסאות שונות לבחור ביניהן. שווה להריץ אותו עצמאית רק אם אתם חייבים שהמידע לא ייצא מהשרת שלכם בגלל פרטיות רפואית. אם אין רגישות כזו ואתם צריכים לסכם טקסטים ארוכים, קריאה ל־API של מודל גדול ומודרני תיתן תוצאה עדיפה בהרבה.

from transformers import pipeline

pipe = pipeline("summarization", model="Falconsai/medical_summarization")
print(pipe("שלום"))

הרישיון

הוא מופץ ברישיון apache-2.0. זה רישיון פתוח שמתיר שימוש מסחרי, שינוי של הקוד והפצה של המודל בתוך מוצר, בלי חובה לפתוח את הקוד שלכם. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗