GPT
W

MedRAG/wikipedia

קוד פתוח

MedRAGרישיון לא דווח2024-02-21

  • medical
  • question answering
  • large language model
  • retrieval-augmented generation

מאגר קטעי ויקיפדיה באנגלית שנחתכו מראש עבור מערכות אחזור לטובת מענה על שאלות רפואיות. הוא חוסך את העבודה השחורה של פירוק האנציקלופדיה למקטעים לצורכי חיפוש והשוואת ביצועים.

  • 7,213הורדות בחודש
  • 21לייקים

מה זה

המאגר כולל 29,913,202 מקטעי טקסט שנלקחו מוויקיפדיה באנגלית מגרסת מרץ 2022. החוקרים הורידו את העיבוד הקיים של ויקיפדיה מהאגינג פייס וחתכו אותו באמצעות LangChain לחתיכות של עד 1,000 תווים, עם ממוצע של 162 תווים לקטע.

המטרה מאחורי האיסוף הייתה לבדוק האם ידע כללי מתוך אנציקלופדיה פתוחה יכול לשפר ביצועים במענה על שאלות רפואיות. כל רשומה מייצגת פסקה ומכילה מזהה ייחודי, כותרת הערך שממנו נלקחה, תוכן המקטע עצמו, ושדה נוסף שמחבר את הכותרת והתוכן יחד, המיועד ישירות למנועי אחזור כמו BM25.

מתאים ל

  • בנצ'מרק למערכות RAG

    הערכת היכולת של מנועי חיפוש לשלוף מידע כללי לצורך מענה על שאלות רפואיות מורכבות.

  • אינדוקס מהיר ל־BM25

    טעינה ישירה של שדה contents למנועי אחזור טקסטואליים ללא צורך בעיבוד מקדים של ויקיפדיה.

  • אימון מודלי הטמעה

    בדיקת ביצועים של מודלי אחזור צפוף מול קורפוס ענק ומגוון של 30 מיליון מקטעים באנגלית.

איפה זה נופל

זהו מאגר ויקיפדיה כללי ולא ספרות רפואית מבוקרת. המידע מגיע מגרסה של מרץ 2022, כך שכל גילוי או שינוי שקרה מאז פשוט לא קיים פה. החיתוך השרירותי של 1,000 תווים עלול לקטוע הקשרים קליניים חשובים באמצע משפט.

התוכן כולו באנגלית בלבד. אם המוצר שלכם צריך לעבוד בעברית, המאגר הזה חסר תועלת ישירה. בנוסף, ויקיפדיה כוללת ערכים מכל תחום אפשרי, מה שמייצר המון רעש במערכות אחזור רפואיות שלא יודעות לסנן תוכן לא רלוונטי.

שאלות
נפוצות

האם המאגר הזה כולל רק ערכים ברפואה?

לא, מדובר בכל ויקיפדיה האנגלית שנחתכה למקטעים. החוקרים השתמשו בכלל המידע הכללי כדי לבדוק איך ידע רחב משפיע על מענה לשאלות רפואיות.

האם יש במאגר טקסטים בעברית?

לא. המאגר מבוסס כולו על גרסת ויקיפדיה באנגלית בלבד, ושמות הקבצים מעידים על כך במפורש.

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

הרישיון בדף לא צוין כלל. למרות שמקור המידע הוא ויקיפדיה שפועלת תחת שיתוף זהה, היעדר רישיון מוגדר למאגר עצמו הופך שימוש מסחרי לבעייתי מבחינה משפטית.

מאיזה תאריך המידע בוויקיפדיה הזו?

הטקסט מבוסס על גזירת ויקיפדיה מ־1 במרץ 2022. כל מידע, עדכון או מחקר שפורסמו לאחר מועד זה אינם נכללים ברשומות.

איך טוענים

המאגר מחולק ל־648 קבצי JSONL בתיקיית chunk, ואין צורך בבקשת אישור גישה מיוחדת כדי להוריד אותו. אפשר למשוך את כל התיקייה בפקודת git clone פשוטה ישירות מול המאגר בהאגינג פייס.

בכל רשומה תמצאו את השדות id, wiki_id, title, content ו־contents. השדה המוכן contents מיועד להזנה ישירה למאחזרים דוגמת Pyserini בלי שתצטרכו לשרשר שוב כותרות וטקסטים בעצמכם.

from datasets import load_dataset

ds = load_dataset("MedRAG/wikipedia")

הרישיון

היוצרים לא הגדירו רישיון בדף המאגר. ויקיפדיה עצמה מופצת תחת רישיון פתוח של ייחוס ושיתוף זהה, אך בהיעדר הצהרה רשמית על הדאטהסט המעובד עצמו, שימוש מסחרי בו חושף אתכם לסיכון משפטי לא ברור. לא הייתי בונה עליו מוצר מסחרי סגור לפני בירור מול המפרסמים.

הרישיון המלא ב־Hugging Face ↗