GPT
P

pubmed

קוד פתוח

MedRAGרישיון לא דווח2024-02-20

  • medical
  • question answering
  • large language model
  • retrieval-augmented generation

מאגר מוכן לשליפה של קרוב ל־24 מיליון כותרות ותקצירים רפואיים מתוך פאבמד. הוא מתאים למי שבונה מנוע חיפוש או מערכת תשובות רפואית באנגלית.

  • 16,756הורדות בחודש
  • 114לייקים

מה זה

המאגר מבוסס על פאבמד, שמכיל במקור מעל 36 מיליון מאמרים ביו-רפואיים. היוצרים סיננו ממנו תת-קבוצה והשאירו רק 23,898,701 רשומות שכוללות כותרת ותקציר תקינים, באורך ממוצע של 296 טוקנים לקטע.

כל שורה מייצגת קטע בודד ממאמר. המבנה כולל מזהה ייחודי לקטע, מזהה מאמר מקורי שנוסף בעדכון מאוחר יותר, את כותרת המאמר, את תוכן התקציר, ושדה שמשרשר יחד את הכותרת והתוכן כדי להקל על שליפה במנועים כמו BM25.

הנתונים מפוצלים למעל אלף קבצי ג'ייסון שיושבים בתיקיית מקטעים, ללא חלוקה מובנית לסט אימון או מבחן.

מתאים ל

  • שליפת מידע רפואי

    אינדוקס הטקסטים לצורך חיפוש מהיר של תקצירים רלוונטיים באמצעות מנועי שליפה.

  • מענה לשאלות ברפואה

    אספקת הקשר עובדתי למודלי שפה שעונים על שאלות אמריקאיות ומבחנים קליניים.

  • הערכת ביצועי חיפוש

    בדיקת איכות של אלגוריתמי אחזור נתונים על בסיס עשרות מיליוני קטעי מאמרים.

איפה זה נופל

החומר מכיל אך ורק טקסטים באנגלית, כך שהוא לא יעזור למי שבונה כלים בעברית או מחפש ספרות רפואית מקומית. בנוסף, יש כאן רק כותרות ותקצירים ולא את הטקסט המלא של המאמרים, מה שמגביל את עומק המידע שאפשר לשלוף. הדאטהסט מתבסס על מצב הספרות הרפואית בעת איסופו ולא משקף מחקרים חדשים שפורסמו מאז, לכן חובה לבדוק התאמה לפני שמשלבים אותו במערכות קליניות רגישות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

בעמוד הדאטהסט לא מופיע רישיון בכלל. במצב כזה אין אישור מפורש לשימוש מסחרי, וכל שימוש כזה כרוך בסיכון משפטי. מי שרוצה להשתמש במידע במוצר צריך לבדוק את תנאי השימוש הרשמיים של המאמרים באתר פאבמד עצמו.

האם יש במאגר טקסטים בעברית?

המאגר מוגדר כולו באנגלית בלבד. כל התקצירים והכותרות שנאספו הגיעו מהספרות הבינלאומית בשפה זו. הוא לא מתאים לפרויקטים שדורשים עיבוד שפה טבעית בעברית או התייחסות למערכת הבריאות בישראל.

איך המידע נאסף ומה הוא מכיל?

היוצרים לקחו את מאגר פאבמד שמכיל מעל 36 מיליון פריטים, וסיננו החוצה מאמרים חסרים. נשארו 23,898,701 רשומות שמכילות כותרת ותקציר תקינים בלבד. המאגר לא כולל את גוף המאמר המלא, אלא רק את התקצירים המעובדים לקטעים.

איך המאגר מאורגן מבחינת קבצים?

הוא מחולק ל־1,168 קבצים בפורמט ג'ייסון בתוך תיקיית מקטעים. המבנה הזה נועד להקל על טעינה במנות, אך דורש תשתית אחסון מספקת כדי לעבד כמעט 24 מיליון רשומות. כל רשומה כוללת מזהים, כותרת, תקציר וגרסה משורשרת שלהם.

איך טוענים

טוענים את המידע דרך שיבוט המאגר באמצעות גיט או בקריאת קבצי הג'ייסון ישירות. המאגר כולל 1,168 קבצים וסדר גודל של עשרות מיליוני רשומות, כך שהורדה ועיבוד מקומי דורשים שטח אחסון משמעותי וזיכרון עבודה מתאים. אין צורך באישור גישה מיוחד כדי להוריד אותו. השדות המרכזיים לעבודה הם התוכן והטקסט המשורשר, לצד המזהים לצורך מעקב אחרי מקור המאמר.

from datasets import load_dataset

ds = load_dataset("MedRAG/pubmed")

הרישיון

היוצרים לא דיווחו על רישיון בעמוד המאגר. מבחינה משפטית, היעדר רישיון מוגדר משאיר את זכויות היוצרים בידי הכותבים המקוריים של המאמרים בפאבמד. המשמעות היא שאי אפשר להניח שמותר להשתמש בזה למוצר מסחרי או לאמן מודל סגור, ויש להסדיר את תנאי השימוש מול מקור המידע בפאבמד לפני פיתוח.

הרישיון המלא ב־Hugging Face ↗