GPT
P

pubmedbert-base-embeddings

קוד פתוח

NeuMLapache-2.02023-10-18

  • sentence-transformers
  • pytorch
  • safetensors
  • bert
  • feature-extraction

הטמעה ייעודית לספרות רפואית ומדעית שממירה פסקאות לווקטורים מדויקים. הוא מתאים למי שבונה חיפוש סמנטי או RAG על מאמרים וזקוק לדיוק שגובר על מודלים כלליים.

  • 109Mפרמטרים
  • 512טוקנים בהקשר
  • 836 MBמשקל הקבצים
  • 854,296הורדות בחודש

מה זה

מדובר במודל שמבוסס על PubMedBERT ועבר כוונון ייעודי למשימות דמיון בין משפטים. הוא ממפה טקסט למרחב וקטורי של 768 ממדים באמצעות ארכיטקטורת ברט עם 12 שכבות. האימון שלו התבסס על זוגות של כותרות ותקצירים מתוך מאגר פאבמד, מה שמעניק לו הבנה של מונחים ביו-רפואיים שנוטים ללכת לאיבוד במודלים כלליים.

בבדיקות מול מודלים מובילים באותו סדר גודל, כמו gte-base או bge-base, הוא מציג יתרון עקבי על מבחנים של ספרות רפואית. במדד פירסון על משימות כמו PubMed QA וסיכומי מאמרים, הוא עוקף מודלים כלליים עם ממוצע של 95.62 לעומת 95.37 של gte ו־93.78 של bge. ההבדלים האלה מורגשים בעיקר בקישור מדויק בין שאלות קליניות לתשובות ארוכות.

מתאים ל

  • חיפוש סמנטי במאמרים

    שליפת מחקרים רפואיים לפי כוונת השאילתה, בזכות אימון ייעודי על זוגות כותרות ותקצירים מפאבמד.

  • שכבת אחזור למערכות RAG

    הזנת פסקאות רפואיות רלוונטיות למודלי שפה, עם התאמה גבוהה של 93.27 במבחני PubMed QA.

  • חלוקה לקבוצות לפי נושא

    קיבוץ מאגר גדול של תמציות מדעיות וקטוריות במרחב של 768 ממדים לזיהוי מגמות ומחקרים דומים.

איפה זה נופל

הוא מוגבל לטקסטים באנגלית בלבד ולא יזהה מונחים בעברית. חלון ההקשר עומד על 512 טוקנים, כך שאי אפשר לדחוס לתוכו מאמר שלם בלי לחתוך אותו לפסקאות קודם לכן. בנוסף, האימון התמקד כולו בטקסטים מתוך פאבמד. אם תנסו להשתמש בו לחיפוש בטקסטים כלליים, שיחות יומיומיות או תוכן שיווקי, הביצועים שלו יהיו נחותים משמעותית בהשוואה למודלי הטמעה רגילים.

שאלות
נפוצות

האם המודל יצליח להתמודד עם שאלות בעברית?

לא. המודל אומן על אנגלית בלבד ומבוסס על מאגר פאבמד. טקסט בעברית לא יקודד נכון ויוביל לתוצאות גרועות בחיפוש.

למה לא להשתמש במודל הטמעה כללי וגדול יותר?

מודלים כלליים מפספסים קישורים בין מושגים ביו-רפואיים נדירים. במבחני השוואה על טקסט מדעי, המודל הזה השיג תוצאות גבוהות יותר ממודלים כלליים מקבילים כמו bge ו־gte.

איך מריצים

המשקל הכולל של הקבצים עומד על 836 מגה-בייט, עם 109 מיליון פרמטרים בדיוק float32. זה גודל קל שרץ בקלות על מעבד רגיל בכל שרת פשוט, ובכרטיס מסך בסיסי הוא יקודד כמויות גדולות של טקסט במהירות גבוהה בלי לדרוש משאבים חריגים.

אפשר לטעון אותו ישירות דרך הספרייה sentence-transformers או דרך txtai בשלוש שורות פייתון. אין כאן שום סיבה טכנית להסתמך על שירות ענן חיצוני או לשלם על קריאות API, כי ההרצה המקומית פשוטה, זולה ושומרת על המידע הרפואי בתוך התשתית שלכם.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("NeuML/pubmedbert-base-embeddings")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו במוצרים מסחריים, לשנות את המשקלים, להפיץ אותו מחדש ולשלב אותו במערכות פנימיות. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי אחריות משפטית מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗