GPT
M

MedCPT-Query-Encoder

קוד פתוח

ncbiother2023-10-24

  • transformers
  • pytorch
  • safetensors
  • bert
  • feature-extraction

מודל שיודע להפוך שאילתות חיפוש ביו-רפואיות לוקטורים מדויקים. הוא מתאים למי שרוצה למצוא מאמרים רפואיים לפי תיאורי מקרה או שאלות קליניות.

  • 109Mפרמטרים
  • 512טוקנים בהקשר
  • 836 MBמשקל הקבצים
  • 128,531הורדות בחודש

מה זה

מדובר באנקודר של כ־109 מיליון פרמטרים שמבוסס על ארכיטקטורת ברט, ומפיק וקטורים מייצגים מטקסטים קצרים כמו שאלות, מונחי חיפוש או משפטים קליניים. המודל אומן על 255 מיליון צמדי שאילתות ומאמרים מתוך לוגים של פאבמד, ולכן הוא מבין שפה רפואית טבעית הרבה יותר טוב ממודלי ברט כלליים.

הוא חלק ממערך של שני מודלים, כשהמקביל שלו מקודד מאמרים שלמים, ושניהם חולקים את אותו מרחב וקטורי. לפי המפתחים הוא הגיע לתוצאות הטובות ביותר במבחני אחזור מידע ביו-רפואי באפס דוגמאות, מה שאומר שאפשר להשתמש בו ישירות על מאגרים רפואיים בלי לאמן אותו מחדש.

מתאים ל

  • חיפוש שאילתות בפאבמד

    הוקטורים של השאילתה מתאימים ישירות למאגר הוקטורי המוכן שפורסם עבור כל מאמרי פאבמד.

  • קיבוץ שאלות קליניות

    הוא ממפה שאלות שונות בעלות אותה משמעות רפואית לאותו אזור במרחב הוקטורי.

  • אחזור מידע לבוטים רפואיים

    משמש שלב ראשון לשליפת מקורות אמינים לפי תלונות של משתמשים באנגלית.

איפה זה נופל

המודל מיועד לטקסטים קצרים בלבד ולא מתאים לקידוד מסמכים ארוכים, לשם כך צריך להוריד את אנקודר המאמרים הנפרד שלהם. המפתחים מציינים שהגרסה שפורסמה כאן שונה במעט מזו שהוצגה במאמר המקורי, כך שביצועים מסוימים עשויים להיות שונים. בנוסף, חל איסור מפורש להשתמש בתוצאות שלו לצורך קבלת החלטות קליניות או אבחון רפואי ישיר ללא פיקוח מקצועי.

שאלות
נפוצות

האם המודל הזה יכול לקודד גם את המאמרים עצמם לצורך חיפוש?

לא, הוא מיועד לשאילתות וטקסטים קצרים. כדי לקודד מאמרים שלמים, כותרות ותקצירים, צריך להשתמש במודל המשלים שנקרא ארטיקל אנקודר, שעובד באותו מרחב וקטורי.

האם חייבים כרטיס מסך כדי להריץ אותו בסביבת ייצור?

ממש לא. מדובר במודל של 109 מיליון פרמטרים בלבד, והוא מייצר וקטור מטקסט קצר במהירות גבוהה גם על גבי מעבד סטנדרטי בלי חומרה ייעודית.

איך מריצים

טוענים את המודל ישירות דרך ספריית טרנספורמרס של פייתון. הוא שוקל פחות מג'יגהבייט, כך שאפשר להריץ אותו בלי שום בעיה על מעבד רגיל של מחשב פיתוח או שרת זול, בלי להשקיע בכרטיס מסך יקר.

אין סיבה לשלם על שירותי ענן חיצוניים כדי לקבל הטמעות לשאילתות כאלה. המודל קל מאוד, רץ מהר, ומשתמשים בו על ידי חילוץ המצב הנסתר של טוקן הסי-אל-אס האחרון עם מקסימום אורך של עד 512 טוקנים.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="ncbi/MedCPT-Query-Encoder")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כאחר ולכן צריך להיכנס למאגר ולבדוק את תנאי השימוש של ממשלת ארצות הברית לפני שמשלבים אותו בקוד מסחרי. אי אפשר להניח שמותר למכור אותו ישירות בלי לקרוא את ההגבלות המשפטיות של האתר המקורי.

הרישיון המלא בעמוד המודל ↗