GPT
T

textbooks

קוד פתוח

MedRAGרישיון לא דווח2024-02-22

  • medical
  • question answering
  • large language model
  • retrieval-augmented generation

המאגר מרכז קטעי טקסט מעובדים מתוך 18 ספרי לימוד רפואיים מרכזיים בארצות הברית. הוא מיועד למי שבונה או בודק מערכות אחזור מידע לשאלות ותשובות ברפואה.

  • 5,512הורדות בחודש
  • 62לייקים

מה זה

הנתונים מבוססים על אוסף הספרים של פרויקט MedQA, שכולל ספרות בסיס המשמשת ללימודים לקראת מבחני ההסמכה הרפואיים בארצות הברית, USMLE. המפרסמים פירקו את הספרים למקטעים קצרים באמצעות כלי החיתוך של LangChain, עם מגבלה של עד 1,000 תווים למקטע.

בסך הכל יש כאן 125,847 רשומות, כשהאורך הממוצע של כל רשומה עומד על 182 תוקנים. כל רשומה כוללת מזהה ייחודי, את שם הספר שממנו נלקחה, גוף הטקסט עצמו, ושדה נוסף שמחבר את שם הספר עם התוכן כדי להקל על מנועי חיפוש מבוססי BM25.

המאגר מחולק לקובצי jsonl לפי נושאים וספרים שונים. אפשר למצוא שם קבצים ספציפיים לאנטומיה של גריי, ביוכימיה של ליפינקוט, ביולוגיה של התא, גינקולוגיה, היסטולוגיה, וספרי הכנה למבחני שלב ראשון ושני של USMLE.

מתאים ל

  • בסיס ידע ל־RAG רפואי

    שליפת פסקאות ממוקדות מספרי לימוד כדי לענות על שאלות קליניות ומבחני הסמכה.

  • הערכת מנועי חיפוש ואחזור

    בדיקת ביצועים של מודלי אחזור כמו BM25 ו־MedCPT על טקסטים רפואיים חתוכים מראש.

  • אימון מודלים להבנת הנקרא

    בניית מאגרים למשימות של שאלות מרובות ברירה על סמך קטעי טקסט רפואיים באנגלית.

איפה זה נופל

כל הטקסטים במאגר כתובים באנגלית בלבד. אין כאן מילה אחת בעברית, ולכן הוא לא מתאים לאימון ישיר על שפה מקומית בלי תרגום או התאמה מוקדמת.

בנוסף, המקורות מייצגים את הסטנדרט הרפואי האמריקאי בלבד ולא פרוטוקולים בינלאומיים אחרים. החיתוך הטכני נעשה לפי אורך תווים בלבד ולא לפי מבנה תוכן קליני, מה שעלול לחתוך משפטים או הקשרים רפואיים קריטיים באמצע.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ בכלל. בעמוד המאגר לא דווח רישיון, והתוכן עצמו מורכב מספרי לימוד רפואיים מסחריים מוגנים בזכויות יוצרים. כל עוד אין אישור ברור מהמוציאים לאור, השימוש מוגבל למחקר.

האם המאגר כולל תוכן בעברית?

לא. כל 125,847 הרשומות מבוססות על ספרות רפואית באנגלית שמיועדת למבחני USMLE האמריקאיים. אין במאגר שפות נוספות.

איך נאסף המידע ואיך הוא עובד?

הטקסטים נלקחו מפרויקט MedQA שמכיל 18 ספרי לימוד רפואיים. החוקרים חילקו את הספרים למקטעים של עד 1,000 תווים באמצעות LangChain, ושמרו אותם כקובצי jsonl לפי ספרים.

האם צריך לבצע עיבוד נוסף לטקסט לפני שימוש ב־RAG?

הטקסט כבר חתוך למקטעים קצרים עם ממוצע של 182 תוקנים. אפשר להשתמש ישירות בשדה contents שמשלב את שם הספר והתוכן לצורך אינדוקס ואחזור.

איך טוענים

טוענים את המאגר ישירות על ידי שכפול ממאגר הגיט שלו בהאגינג פייס. הגישה חופשית ואין צורך בהרשאה מיוחדת או באישור מוקדם כדי להוריד את 20 הקבצים ששמורים בו.

הנתונים מגיעים כקובצי jsonl בתוך תיקיית chunk. השדות העיקריים שצריך לעבוד איתם הם content לקריאת המידע הרפואי, או contents אם אתם מריצים חיפוש טקסטואלי ישיר, יחד עם title שמזהה את מקור הספר.

from datasets import load_dataset

ds = load_dataset("MedRAG/textbooks")

הרישיון

המפרסמים לא ציינו רישיון שימוש בעמוד המאגר. מדובר בטקסטים שנלקחו מתוך 18 ספרי לימוד רפואיים מוכרים ומוגנים בזכויות יוצרים מסחריות. שימוש במאגר הזה לפיתוח מוצר מסחרי או מודל שמיועד להפצה כרוך בסיכון משפטי ברור, ומתאים כרגע רק למחקר אקדמי ולניסויים פנימיים.

הרישיון המלא ב־Hugging Face ↗