GPT
M

medical_meadow_wikidoc_patient_information

קוד פתוח

medalpacacc2023-04-06

המאגר מרכז שאלות ותשובות רפואיות שמיועדות למטופלים מתוך אתר ויקידוק. הוא מתאים למי שרוצה לאמן מודל שיחה רפואי שמסביר מושגים בגובה העיניים.

  • 3,520הורדות בחודש
  • 32לייקים

מה זה

הנתונים נאספו ישירות מתוך מדור המידע למטופלים באתר ויקידוק, פלטפורמה שיתופית שבה אנשי צוות רפואי מעדכנים ידע קליני שוטף. המבנה מבוסס על צמדים של שאלות ותשובות, כשהמקור כולל כותרות משנה שבמקור כבר נכתבו בצורת שאלות, ולכן הטקסט בפסקאות שתחתיהן נלקח ישירות כתשובה בלי התערבות נוספת.

היוצרים מציינים שהאתר כולל גם חלק נפרד של ספר לימוד רפואי, שם נעשה שימוש במודל שפה כדי להמציא שאלות, אבל במאגר הספציפי הזה של מידע למטופלים הנתונים הגיעו ישר מהמקור. למרות זאת, הכרטיס מצהיר על הפרויקט כולו כעבודה בתהליך, ומזהיר מפני שגיאות המרה שמקורן בחלקים שונים של איסוף הנתונים הרחב יותר במיזם.

מתאים ל

  • אימון מודל הסברה

    לימוד מודלים איך לענות על בעיות רפואיות שכיחות בשפה ברורה המובנת לציבור הרחב.

  • הערכת ביצועים רפואיים

    בדיקה של יכולת מודל קיים להתמודד עם שאלות ישירות של חולים באנגלית.

  • מחקר על דאטה שיתופי

    ניתוח איכות הידע הרפואי שנוצר בפלטפורמות מבוססות קהילה מקצועית.

איפה זה נופל

היוצרים מודים בגלוי שהמאגר נמצא בעבודה ולא עבר ניקוי סופי, כשבחלקים אחרים של המיזם שיעור התוצאות הלא מספקות הגיע לכשלושים אחוזים. כל הטקסט באנגלית בלבד, ואין פה התאמה לעברית או לטרמינולוגיה של מערכת הבריאות המקומית. בנוסף, מדובר בתוכן שיתופי שנאסף מרשת האינטרנט, כך שחייבים לבדוק ידנית את הדיוק הקליני לפני שחושפים אותו למשתמשים אמיתיים כדי לא לפלוט מידע שגוי למטופלים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון בכרטיס מסומן רק כקריאייטיב קומונס בלי לציין תת סוג ספציפי. במצב כזה לא בטוח שמותר להשתמש בנתונים למטרות רווח או אם חלה חובת שיתוף זהה על המודל. כדאי לפנות למפתחים בגיטהאב לפני שרצים לשלב את זה במערכת מסחרית.

האם הדאטהסט כולל שאלות ותשובות בעברית?

לא, כל המאגר נאסף מוויקידוק באנגלית בלבד. אם המטרה היא מערכת דוברת עברית, תצטרכו לתרגם את השדות או להשתמש בו לאימון מקדים של מודל רב לשוני. גם המונחים הרפואיים משקפים את המינוח המקובל בארצות הברית.

איך יצרו את השאלות והתשובות בקבצים?

במדור המידע למטופלים כותרות המשנה כבר נכתבו מראש כשאלות. הצוות לקח את הכותרות האלו כמו שהן והצמיד להן את פסקת הטקסט המקורית כתשובה. הם לא היו צריכים להפעיל מודלים כדי לנסח את השאלות מחדש בחלק הזה של המאגר.

מה ההבדל בינו לבין המאגר הכללי של ויקידוק באותו פרויקט?

המאגר הכללי נלקח מספר הלימוד הרפואי של האתר, ושם היוצרים השתמשו במודל שפה חיצוני כדי לייצר שאלות מכותרות רגילות. המאגר הנוכחי מתמקד בהסברים למטופלים, ולכן השאלות בו טבעיות יותר והניסוחים פשוטים וקריאים בהרבה.

איך טוענים

אתם מושכים את הקובץ ישירות דרך ספריית הדאטהסטים של האגינג פייס בעזרת המזהה של הפרויקט, או מורידים את קובץ הג'ייסון הבודד מהמאגר. אין צורך באישור גישה מוקדם או במילוי טפסים, הקובץ פתוח לחלוטין לקריאה מיידית. הקובץ המרכזי מגיע בפורמט ג'ייסון סטנדרטי של שאלות ותשובות ומכיל טקסט בלבד, כך שלא נדרש זיכרון חריג או חומרה מיוחדת כדי לטעון אותו לזיכרון ולפרק אותו למבנה הרצוי. השדות החשובים כוללים את השאלה ואת תוכן התשובה הרפואית שנלווית אליה.

from datasets import load_dataset

ds = load_dataset("medalpaca/medical_meadow_wikidoc_patient_information")

הרישיון

הרישיון מוגדר באופן כללי כקריאייטיב קומונס, אבל בלי פירוט של הגרסה המדויקת או התנאים המסחריים. חוסר הבהירות הזה אומר שקשה לדעת בוודאות אם מותר לשלב אותו במוצר רווחי או להפיץ מודל סגור שאומן עליו, ועדיף להגביל את השימוש למחקר ולניסויים פנימיים בלבד.

הרישיון המלא ב־Hugging Face ↗