GPT
M

medical-question-answering-datasets

קוד פתוח

Malikeh1375mit2023-10-27

  • medical
  • clinical
  • healthcare

אוסף רחב של שאלות ותשובות רפואיות באנגלית ממקורות קליניים ומחקרים מדעיים. מתאים לאימון והערכה של מודלי שפה בתחומי הבריאות שמחפשים מגוון סגנונות במקום אחד.

  • 2,020הורדות בחודש
  • 80לייקים

מה זה

המאגר מאגד נתונים מעשרה מקורות מוכרים שונים מעולמות הרפואה, ומציג אותם במבנה אחיד של הוראה, קלט ופלט. תמצאו כאן שיחות ייעוץ בין רופאים למטופלים מתוך מאגרי ChatDoctor כמו HealthcareMagic ו־iCliniq, לצד כרטיסיות לימוד רפואיות, שאלות בחינה אמריקאיות מ־MedQA ו־MMMLU, ומידע למטופלים מ־WikiDoc.

החלק הגדול ביותר באוסף נשען על קורפוס המחקרים של CORD19 עם מעל שמונה מאות אלף דוגמאות, לצד קטעים סיבתיים מ־PubMed ומאגרי MediQA. כל המקורות עברו התאמה לתבנית אימון הוראות סטנדרטית, והמאגר כולל גם תצורה אחת בשם all-processed שמרכזת חלק מהנתונים המעובדים בהיקף של כרבע מיליון רשומות.

מתאים ל

  • אימון מודל הוראות רפואי

    התאמת מודלי שפה למענה על שאלות קליניות תוך שימוש במבנה אחיד של instruction ו־output.

  • הערכת ביצועים במענה רפואי

    בדיקת יכולת המודל במבחני ידע מקצועיים מתוך חלקי ה־MedQA וה־MMMLU.

  • פיתוח עוזרי שיחה למטופלים

    אימון צ'אטבוטים על גבי דיאלוגים מציאותיים בין רופאים לחולים ממאגרי ייעוץ.

איפה זה נופל

כל הטקסטים במאגר כתובים באנגלית בלבד, כך שאינם מתאימים ישירות לפיתוח יישומים בעברית ללא תרגום מקדים. בנוסף, הנתונים הם שעטנז של התייעצויות רשת לא מבוקרות ומאמרים אקדמיים, ללא חלוקה מובנית לסט מבחן או אימות. חובה לבצע סינון קפדני לפני שימוש במוצר קליני אמיתי כדי למנוע ייעוץ שגוי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון MIT מתיר שימוש מסחרי מלא. עליכם לכלול את הצהרת הרישיון וזכויות היוצרים בכל עותק או תוצר נגזר.

האם הדאטהסט כולל תמיכה בעברית?

לא, כל הרשומות במאגר כתובות באנגלית בלבד. כדי להשתמש בו עבור יישומים בעברית תצטרכו לתרגם את הנתונים או לאמן מודל רב-לשוני.

כמה מקום שוקל המאגר להורדה?

הגודל תלוי בתצורה שתבחרו לטעון. החלק הגדול ביותר, CORD19, שוקל כ־750 מגה-בייט להורדה, בעוד תצורות קטנות יותר דורשות מגה-בייטים בודדים בלבד.

מאיפה הגיעו הנתונים שבפנים?

המאגר מרכז מספר פרויקטים פתוחים קודמים בתחום הרפואה, כולל נתוני ChatDoctor ויוזמת Medical Meadow. הוא משלב שאלות מבחנים, מאמרים מ־PubMed ודיאלוגים מפורומים רפואיים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון שם התצורה המבוקשת, למשל medical_meadow_medqa או הגרסה המאוחדת all-processed. המאגר פתוח לגמרי, ללא צורך בהרשמה מיוחדת או אישור גישה מראש. הקבצים מאוחסנים בפורמט Parquet, כאשר כל רשומה כוללת שלושה שדות טקסט פשוטים: instruction, input ו־output.

from datasets import load_dataset

ds = load_dataset("Malikeh1375/medical-question-answering-datasets")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗