GPT
M

medical_meadow_wikidoc

קוד פתוח

medalpacacc2023-04-06

זוגות שאלות ותשובות רפואיות שחולצו מאנציקלופדיית הרופאים WikiDoc בעזרת מודל שפה. הוא מיועד למי שרוצה לאמן מודל שיחה רפואי על בסיס טקסטים מקצועיים.

  • 4,882הורדות בחודש
  • 56לייקים

מה זה

הנתונים מבוססים על חומר שנאסף מתוך אתר WikiDoc, אתר שיתופי שבו אנשי מקצוע מעולם הרפואה כותבים ומעדכנים ידע קליני. החוקרים סרקו את החלק שנקרא Living Textbook, שכולל פרקים מקצועיים מתחומי התמחות שונים ברפואה.

כדי לייצר שאלות ותשובות, הם לקחו את כותרת הפסקה המקורית והשתמשו במודל GPT-3.5-Turbo כדי לנסח אותה מחדש כשאלה. תוכן הפסקה עצמה הוצמד לשאלה הזו ושימש כתשובה ישירה. החלק שמכיל מידע למטופלים לא נכלל כאן אלא הופרד למאגר נפרד, משום ששם תת הכותרות כבר היו מנוסחות כשאלות מראש ולא דרשו עיבוד כזה.

מתאים ל

  • אימון מודלי שיחה רפואיים

    כוונון עדין של מודלי שפה למענה על שאלות בנושאים קליניים ומחלות על בסיס ידע של רופאים.

  • הערכת ביצועים ברפואה

    בדיקת היכולת של מודל קיים להתמודד עם שאלות רפואיות מקצועיות שמנוסחות בשפה טבעית.

  • ניקוי וסינון נתונים

    פיתוח אלגוריתמים לזיהוי שאלות פגומות שנוצרו על ידי בינה מלאכותית וסינונן מהמאגר.

איפה זה נופל

היוצרים עצמם מודים שהמאגר נמצא בעבודה ואינו נקי. הניסוח מחדש באמצעות מודל השפה יצר תוצאות לא מספקות בכשלושים אחוז מהמקרים, ולכן אי אפשר להסתמך עליו בעיניים עצומות. בנוסף, כל המידע קיים באנגלית בלבד. אם המטרה שלכם היא מודל שמשרת מטופלים בעברית או מיועד להטמעה במערכת רפואית פעילה, תצטרכו לעשות סינון ידני מקיף או לבדוק כל תשובה לגופה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

זה לא חד משמעי. הרישיון המדווח הוא cc כללי בלי פירוט של תנאי הרישיון המדויקים, ולכן אין אישור מפורש לשימוש מסחרי. כדאי לבדוק את תנאי השימוש באתר המקור WikiDoc לפני שמשלבים אותו במוצר שמייצר הכנסות.

האם יש במאגר טקסטים בעברית?

לא. כל הנתונים נאספו באנגלית בלבד. אם המטרה היא לעבוד עם עברית, תצטרכו לתרגם את הנתונים בעצמכם או להשתמש במאגר אחר שכולל שפות נוספות.

איך יצרו את השאלות והתשובות?

החוקרים לקחו פסקאות מתוך פרקים מקצועיים באתר WikiDoc. הם שלחו את כותרת הפסקה ל־GPT-3.5-Turbo כדי שינסח אותה כשאלה, וקבעו את גוף הפסקה בתור התשובה המתאימה.

במה הוא שונה ממאגר המידע למטופלים של אותו פרויקט?

המאגר הנוכחי נלקח מחלק האתר שמיועד לרופאים, ובו הכותרות עברו המרה לשאלות בעזרת בינה מלאכותית עם שיעור שגיאות מסוים. המאגר של מידע למטופלים התבסס על כותרות שכבר נכתבו במקור כשאלות, ולכן הוא מדויק יותר ולא דרש המרה כזו.

איך טוענים

טוענים את הקובץ ישירות מתוך המאגר באמצעות ספריית datasets עם הנתיב medalpaca/medical_meadow_wikidoc, או מורידים את קובץ ה־json היחיד שנמצא שם, ששמו medical_meadow_wikidoc.json.

הגישה פתוחה לחלוטין ואין צורך בהרשמה מיוחדת או באישור ידני של היוצרים. המאגר כולל בסך הכל שלושה קבצים, והמידע עצמו מרוכז כולו באותו קובץ נתונים, כך שלא צריך להסתבך עם חיבור בין טבלאות שונות לפני שמתחילים לעבוד.

from datasets import load_dataset

ds = load_dataset("medalpaca/medical_meadow_wikidoc")

הרישיון

המאגר מסומן תחת רישיון כללי של Creative Commons מסוג cc, אך הכרטיס אינו מפרט את תת הסוג המדויק, כמו ייחוס, שיתוף זהה או הגבלה לשימוש לא מסחרי. חוסר הבהירות הזה אומר שאי אפשר לדעת בוודאות אם מותר להשתמש בו לאימון מודל מסחרי, ומומלץ לבדוק את תנאי השימוש המקוריים באתר WikiDoc לפני שמשלבים אותו במוצר.

הרישיון המלא ב־Hugging Face ↗