GPT
C

Clinical_ModernBERT

קוד פתוח

Simonlee711mit2025-03-27

  • transformers
  • safetensors
  • bert
  • fill-mask
  • biomedical-text

מודל אנקודר קומפקטי שמיועד לטקסט רפואי ומציע חלון הקשר ארוך במיוחד. הוא מתאים למי שחייב לעבד רשומות קליניות שלמות בלי לקטוע אותן באמצע.

  • 137Mפרמטרים
  • 8,192טוקנים בהקשר
  • 525 MBמשקל הקבצים
  • 5,664הורדות בחודש

מה זה

מדובר באנקודר של 137 מיליון פרמטרים שמבוסס על ModernBERT ועבר אימון ייעודי על 13 מיליארד טוקנים של ספרות רפואית ממאגר PubMed, רשומות קליניות ממאגר MIMIC-IV ותיאורי קודי מחלות. השוני המרכזי בינו לבין מודלי BERT קליניים ותיקים הוא השילוב של Flash Attention, שכבות GeGLU וקידוד מיקום יחסי, שמאפשרים לו להחזיק מסמך שלם בלי לחנוק את הזיכרון.

במקום לעצור אחרי 512 טוקנים כמו מודלים ישנים, הוא תומך ברצפים של עד 8,192 טוקנים. במבחן שחזור המילים המוסתרות שעליו אומן, הוא פגע במילה המדויקת ב־63.31% מהמקרים, וב־88.1% מהמקרים המילה הנכונה הייתה בין 25 האפשרויות המובילות שלו, מה שמעיד על היכרות טובה עם שמות תרופות ומינוחים מקצועיים.

מתאים ל

  • שליפת מידע במערכות RAG

    יצירת וקטורים מדויקים מתיקים רפואיים ארוכים בלי לחתוך פסקאות ובלי לאבד את ההקשר של ההיסטוריה הטיפולית.

  • סיווג תיקים ומסמכים

    התאמת המודל לסיווג מחלקתי או לאיתור חריגות בתוך דוחות קליניים מורכבים שמכילים אלפי טוקנים.

  • מיפוי קודים רפואיים

    זיהוי אוטומטי של אבחנות ופרוצדורות מתוך טקסט חופשי בזכות האימון המוקדם שכלל קודי ICD ותיאוריהם.

איפה זה נופל

המודל תומך באנגלית בלבד ואומן על טקסטים באנגלית, כך שהוא לא יעזור בכלל לניתוח תיקים רפואיים בעברית. בנוסף, זהו אנקודר למשימות חילוץ ייצוגים ולא מודל שמייצר טקסט חופשי, כך שלא תוכלו לבקש ממנו לנסח סיכום מחלה או לענות ישירות לשאלות של מטופלים.

הוא מספק וקטורים ומסווג קטגוריות, אבל בשביל משימות קצה מעשיות כמו מיפוי קודים או סיווג מסמכים תצטרכו לאמן עליו שכבת התאמה נוספת.

שאלות
נפוצות

האם אפשר להשתמש בו כדי לעבד סיכומי ביקור של קופות חולים בארץ?

לא בלי אימון מחדש. המודל הוגדר ואומן על שפה אנגלית בלבד, ואין לו הבנה של מונחים רפואיים בעברית או של עברית בכלל.

האם הוא יכול להחליף מודל כמו GPT לצורך מתן המלצות לרופאים?

לא. זהו מודל מסוג אנקודר שנועד להוציא ייצוגים וקטוריים ולסווג טקסט, ולא מודל שיחה שיוצר פלט טקסטואלי אוטונומי.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות AutoModel ו־AutoTokenizer. המשקל הכולל של הקבצים עומד על 525 מגה-בייט, כך שהוא ירוץ בלי בעיה על מעבד סטנדרטי או על כל כרטיס מסך בסיסי עם כמה ג'יגה-בייט בודדים של זיכרון.

אם רוצים לנצל את חלון ההקשר המלא של 8,192 טוקנים, תצטרכו כרטיס שתומך ב־Flash Attention כדי לשמור על מהירות וחיסכון בזיכרון. אין שום סיבה לשלם לספק חיצוני על API בשביל גודל כזה, קל וזול בהרבה להרים אותו עצמאית בשרת מקומי.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="Simonlee711/Clinical_ModernBERT")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 525 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, מה שאומר שמותר להשתמש בו לכל מטרה, כולל מוצרים מסחריים וקוד סגור. התנאי היחיד הוא לשמור על הודעת זכויות היוצרים ונוסח הרישיון המקורי בתוך הקוד או ההפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗