GPT
M

MedQuAD

קוד פתוח

lavitaרישיון לא דווח2023-10-19

  • medical

מאגר שאלות ותשובות רפואיות באנגלית שמבוסס על מקורות אמינים, עם שיוך למושגי UMLS. מי שבונה מודל רפואי ירצה אותו בעיקר בגלל התיוג של סוגי השאלות והישויות.

  • 5,494הורדות בחודש
  • 24לייקים

מה זה

הנתונים מגיעים מהפרויקט המקורי של MedQuAD, שהומר כאן לפורמט נוח יותר לעבודה. הרשומות מציגות זוגות של שאלות ותשובות רפואיות שחולצו ממקורות בריאות מוסמכים, כשהן מקושרות למושגים מתוך Unified Medical Language System. בשדות שמכילים מזהי CUI, סוגים סמנטיים או שמות נרדפים, הערכים מופרדים באמצעות התו קו אנכי.

יש הבדל קריטי בין הגרסה הזו למקור. המפרסמים הסירו 31,034 תשובות מארבעה מקורות שונים: GARD, ADAM, MPlusHerbsSupplements ו־MPlusDrugs, כדי להימנע מהפרת זכויות יוצרים של MedlinePlus. המשמעות היא שחלק ניכר מהמידע התרופתי והמחלות הנדירות נשאר בלי תשובות בפועל, אלא רק עם שאלות.

מתאים ל

  • אימון מענה לשאלות באנגלית

    פיין טיונינג של מודלים לחילוץ או יצירת תשובות רפואיות, רק מתוך הרשומות שבהן התשובה לא הוסרה.

  • סיווג שאלות רפואיות

    אימון מסווגים שמזהים אם שואלים על בדיקות, אבחון, תופעות לוואי או מתי לפנות לרופא.

  • קישור ישויות רפואיות

    שימוש במזהי ה־CUI והסוגים הסמנטיים כדי להעריך מודלים שמזהים מושגי UMLS בטקסט חופשי.

איפה זה נופל

הנתונים קיימים באנגלית בלבד, ואין כאן אף מילה בעברית. המגבלה הבולטת ביותר היא 31,034 רשומות שבהן התשובות נמחקו לחלוטין משיקולי זכויות יוצרים, כך שאי אפשר לאמן עליהן משימות יצירת טקסט בלי לנקות אותן קודם. בנוסף, יש אי התאמות בין סוגי השאלות שמופיעים במאמר המקורי לבין אלה שבמאגר עצמו, למשל סוגים כמו stages או precautions שלא ברור איך הם ממופים למחקר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא כדאי להסתכן בלי בירור משפטי. הרישיון לא מוגדר בעמוד, והמפרסמים עצמם נאלצו לחתוך ממנו עשרות אלפי רשומות בגלל בעיות זכויות יוצרים מול MedlinePlus.

האם יש במאגר נתונים בעברית?

לא. כל השאלות, התשובות והמושגים הרפואיים מופיעים באנגלית בלבד.

מדוע חסרות תשובות בחלק מהרשומות?

31,034 תשובות הוסרו בגלל זכויות יוצרים של מקורות כמו ADAM ו־MedlinePlus. השאלות נשארו, אך התשובות נמחקו כדי לא להפר זכויות.

איך מחלקים את המאגר לטריין וטסט?

הנתונים מגיעים כקובץ פרקט יחיד תחת חלוקת train. תצטרכו לפצל אותו בעצמכם לסט אימון, ולידציה ובדיקה לפי הצרכים שלכם.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות המזהה lavita/MedQuAD. כל המידע יושב בקובץ פרקט יחיד, train-00000-of-00001, כך שלא צריך להמתין להורדות כבדות ומורכבות או לחבר כמה חלקים. אין צורך באישור גישה מוקדם או בטפסים. בעבודה עם הנתונים, שימו לב לעמודות של ה־CUI והסוגים הסמנטיים כדי לחלץ את הישויות הרפואיות.

from datasets import load_dataset

ds = load_dataset("lavita/MedQuAD")

הרישיון

הרישיון במאגר לא דווח. מעבר לכך שהמפרסמים הסירו מעל שלושים אלף תשובות בגלל זכויות יוצרים של MedlinePlus, אי הבהירות המשפטית לגבי שאר הדאטה בעייתית. אם אתם מתכננים לבנות מודל מסחרי או לשחרר מוצר פתוח, אל תיגעו בזה לפני בדיקה מול החוקרים שפרסמו את המאמר המקורי.

הרישיון המלא ב־Hugging Face ↗