GPT
M

medical_questions_pairs

קוד פתוח

curaihealthunknown2022-03-02

רופאים יצרו כאן זוגות של שאלות רפואיות דומות ושונות בכוונה כדי לבחון מודלים סמנטיים. המטרה היא למנוע ממודל ליפול על דמיון שטחי של מילים.

  • 1,973הורדות בחודש
  • 50לייקים

מה זה

המאגר מכיל 3,048 זוגות של שאלות רפואיות שנכתבו ותויגו בידי 11 רופאים מצוות חברת Curai. נקודת המוצא הייתה 1,524 שאלות שנשאלו במקור על ידי מטופלים ונלקחו מדגימה אקראית של סריקה ציבורית מאתר HealthTap. כל שאלה מקורית שימשה בסיס ליצירת שני זוגות שונים, אחד חיובי ואחד שלילי.

עבור הזוג החיובי, הרופאים התבקשו לנסח מחדש את השאלה תוך שמירה על אותה כוונה רפואית, שינוי תחבירי מרבי ושינוי פרטים דמוגרפיים שלא ישפיעו על המענה הקליני. עבור הזוג השלילי, הרופאים כתבו שאלה קרובה שמשתמשת במילים דומות אך התשובה לשאלה המקורית תהיה שגויה או לא רלוונטית עבורה. המבנה הזה נועד לאלץ את המודל להבין משמעות קלינית ולא להסתמך על חפיפת מילים.

כל שורה בדאטה כוללת מזהה רופא מתוך 11 הרופאים, את השאלה המקורית, את השאלה המשוכתבת ותווית בינארית של 1 לזוג דומה ו־0 לזוג שאינו דומה. כל הנתונים מרוכזים בפיצול יחיד שנקרא train ומחולק בדיוק שווה בשווה בין 1,524 זוגות דומים ל־1,524 זוגות שונים.

מתאים ל

  • הערכת מודלי דמיון רפואי

    בדיקת ביצועים של מודלי שפה בזיהוי כוונה קלינית זהה ללא תלות במילים משותפות.

  • אימון מסווג שאלות קליניות

    פיין טיונינג למודלי סיווג שמנתבים פניות של מטופלים למאגרי תשובות קיימים.

  • בדיקת חוסן נגד התאמה שטחית

    בחינה האם מודל נופל בפניות שמכילות מונחים דומים אך משמעות רפואית הפוכה.

איפה זה נופל

הטקסט כולו באנגלית בלבד ומבוסס על שאלות של משתמשי אתר רפואי אמריקאי משנת 2020 ומטה, ללא התאמה לעברית או למינוח קליני ישראלי. הכרטיס לא מספק מידע על ניקוי מידע מזהה או רגיש, ולא מפרט הטיות דמוגרפיות של השואלים המקוריים. בנוסף, 11 רופאים בלבד יצרו את כל הניסוחים מחדש, מה שיוצר סכנה להטיה סגנונית אישית שתשפיע על המודל שלכם.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

הרישיון הרשמי בעמוד מסומן כלא ידוע ואין פירוט על זכויות השימוש בכרטיס. במצב כזה מומלץ לא לבנות עליו מוצר מסחרי בלי לקבל אישור ישיר מחברת Curai.

האם הנתונים כוללים עברית או תרגום כלשהו?

הטקסט כולו באנגלית שנאספה ממשתמשי אתר HealthTap. אין במאגר עברית, ולשימוש מקומי תידרשו לתרגם את השאלות ולהתאים מונחים רפואיים.

כמה גדול המאגר ואיך מקבלים אליו גישה?

המאגר קטן מאוד ומכיל 3,048 שורות בקובץ parquet יחיד. הגישה אליו חופשית לחלוטין דרך Hugging Face ללא צורך באישור ידני או הרשמה מוקדמת.

איך נאספו השאלות והתשובות במאגר?

החוקרים לקחו 1,524 שאלות מתוך סריקה ציבורית של אתר HealthTap ונתנו ל־11 רופאים לנסח לכל אחת גרסה דומה וגרסה מטעה. התוצאה כוללת חצי זוגות דומים וחצי שונים.

איך טוענים

טוענים את הקובץ ישירות מקובץ parquet בודד שנמצא בתיקיית המאגר דרך ספריית datasets בלי צורך באישור גישה מוקדם או בהרשמה מיוחדת. המאגר קל מאוד ומכיל 3,048 שורות בלבד, כך שהוא נטען תוך שניות ומתאים גם לעבודה מקומית על מחשב נייד רגיל ללא צורך במשאבי חישוב כבדים.

לפני שמתחילים לרוץ כדאי לשים לב שאין חלוקה מובנית לסט מבחן או אימות, ויש לפצל את הנתונים עצמאית לפי מזהה הרופא dr_id כדי למנוע דליפת סגנון כתיבה בין שלבי האימון והבדיקה. השדות המרכזיים שמעניינים אתכם בקוד הם שתי השאלות question_1 ו־question_2 לצד התווית label שמחזירה אפס או אחת.

from datasets import load_dataset

ds = load_dataset("curaihealth/medical_questions_pairs")

הרישיון

הרישיון המדווח במאגר מסומן כלא ידוע, וכרטיס המידע אינו כולל שום פירוט על תנאי שימוש, זכויות יוצרים או היתר לשימוש מסחרי. מבחינה משפטית, אי אפשר לדעת אם מותר לשלב את הנתונים במוצר מסחרי, לאמן עליהם מודל שנמכר ללקוחות או להפיץ נגזרות שלהם. כל שימוש מחוץ למחקר אקדמי דורש פנייה ישירה ליוצרים לבירור מעמד הקוד והנתונים.

הרישיון המלא ב־Hugging Face ↗