GPT
M

MedEmbed-large-v0.1

קוד פתוח

abhinandapache-2.02024-10-20

  • sentence-transformers
  • safetensors
  • bert
  • medembed
  • medical-embedding

מודל שיכוך ייעודי לטקסטים רפואיים וקליניים באנגלית. הוא מיועד למי שבונה חיפוש סמנטי או אחזור מסמכים מעל מאגרים מקצועיים כמו מחקרים ותיקים רפואיים.

  • 335Mפרמטרים
  • 512טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 57,095הורדות בחודש

מה זה

הבסיס כאן הוא המודל המוכר bge-large-en-v1.5 שעבר אימון נוסף על דאטה־סטים רפואיים מובהקים כמו NFCorpus ו־TRECCOVID. המטרה שלו היא לפתור בעיה שכיחה במודלים כלליים, שבהם שמות של מחלות, תרופות או קיצורים קליניים מקבלים וקטורים מרוחקים למרות שיש ביניהם קשר ישיר.

התוצאות במבחני הביצועים מראות איפה הכוח שלו ואיפה הוא נעצר. במבחן CUREv1 באנגלית הוא מציג דיוק ראשוני גבוה עם מדד mrr@1 של 71.95 ו־precision@1 של 71.95, מה שאומר שהתוצאה הראשונה שהוא מחזיר לרוב פוגעת בול. עם זאת, בדירוג מחדש במבחן CMedQAv2 הוא הגיע לציון map של 18.38 בלבד, כך שלא מדובר בפתרון קסם לכל משימת מיון.

מתאים ל

  • אחזור מידע למערכות RAG

    שליפת פסקאות מתוך מאמרים רפואיים באנגלית עבור מודל שפה מייצר.

  • חיפוש סמנטי בקטלוג תרופות

    התאמת שאילתות חיפוש חופשיות לשמות גנריים ומונחים קליניים.

  • סיווג שאלות ותשובות

    התאמה מהירה בין שאלות של מטופלים למאגרי מידע קיימים באנגלית.

איפה זה נופל

הוא מוגבל לחלון של 512 טוקנים, ולכן תצטרכו לחתוך מאמרים ארוכים או תיקים רפואיים מפורטים לפסקאות קצרות לפני השיכוך. בנוסף, המודל מיועד ומאומן לאנגלית בלבד. התוצאות שלו במבחני CUREv1 בספרדית וצרפתית צנחו ל־ndcg@10 של 16.14 ו־24.15, ואין שום מידע או תיעוד על תמיכה בעברית.

שאלות
נפוצות

האם כדאי להשתמש בו לטקסטים רפואיים בעברית?

לא. המודל אומן על אנגלית בלבד, ובמבחנים בשפות אחרות כמו צרפתית וספרדית הביצועים שלו התרסקו. לעברית עדיף להשתמש במודל רב־לשוני חזק.

האם הוא יכול להחליף מודל דירוג מחדש ייעודי?

לא מומלץ. בבדיקת CMedQAv2 לרנקינג הוא השיג תוצאה נמוכה של 18.38 בלבד, ולכן עדיף להשתמש בו בשלב השליפה הראשונית בלבד.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers בפייתון. הקבצים שוקלים 1.2 גיגה־בייט ומכילים 335 מיליון פרמטרים, כך שאפשר להריץ אותו בקלות על מעבד רגיל של שרת או על כרטיס מסך פשוט יחסית, בלי צורך במערכי מחשוב כבדים.

בגודל הזה אין שום סיבה אמיתית לשלם על API חיצוני. הרצה מקומית תיתן לכם שליטה מלאה, זמני תגובה יציבים, וחשוב מכך, הטקסטים הרפואיים הרגישים שלכם לא ייצאו החוצה לצד שלישי.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("abhinand/MedEmbed-large-v0.1")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר ולסגור את הקוד שלכם, כל עוד משאירים את הודעת זכויות היוצרים של היוצר המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗