GPT
M

med_qa

קוד פתוח

bigbiounknown2022-11-13

שאלות רב ברירה ממבחני הסמכה רפואיים באנגלית ובסינית, שמיועדות לבחינת יכולת הסקת מסקנות קלינית. המאגר מציע שאלות מקצועיות אמיתיות יחד עם טקסטים רפואיים תומכים.

  • 11,697הורדות בחודש
  • 157לייקים

מה זה

המאגר מכיל שאלות מבחני הסמכה רפואיים מקצועיים בשלוש שפות: אנגלית, סינית פשוטה וסינית מסורתית. באנגלית יש 12,723 שאלות, בסינית פשוטה 34,251 שאלות, ובסינית מסורתית 14,123 שאלות. השאלות בנויות במבנה של שאלות רב ברירה פתוחות, וכוללות תרחישים רפואיים שדורשים ידע קליני מעמיק.

לצד השאלות עצמן, המאגר כולל קורפוס טקסטים מתוך ספרי לימוד רפואיים, שנועד לאפשר למודלים של הבנת הנקרא לשלוף את המידע הנחוץ למתן התשובה. הקבצים מחולקים לתצורות שונות, כולל גרסאות של ארבע אפשרויות בחירה ומבנים מותאמים לפי סכמת bigbio לקבוצות אימון, בדיקה ואימות.

מתאים ל

  • בנצ׳מרק למודלים רפואיים

    הערכת היכולת של מודלי שפה לפתור שאלות קליניות ברמת מבחני הסמכה באנגלית ובסינית.

  • אימון מערכות הבנת הנקרא

    פיתוח מודלים ששולפים ידע מספרי לימוד רפואיים כדי לנמק ולענות על שאלות.

  • בדיקת הסקת מסקנות קלינית

    בחינת יכולת המודל לזהות מחלות על סמך תיאורי מקרים ומספר אפשרויות אבחון.

איפה זה נופל

אין כאן מילה אחת בעברית. הנתונים מתמקדים באנגלית ובסינית בלבד, כך שהם לא יעזרו ישירות לתרחישים רפואיים מקומיים בישראל בלי התאמה ותרגום. השאלות מבוססות על מבחני הסמכה, ולכן הן משקפות ידע תיאורטי ומבחני ולא שיחות חופשיות עם מטופלים או תיקים רפואיים אמיתיים. בנוסף, המידע מבוסס על ספרי לימוד ומבחנים שפורסמו עד שנת 2021, כך שעדכונים רפואיים מאוחרים יותר חסרים כאן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הרשמי מוגדר כלא ידוע, ולכן אין אישור מפורש לשימוש מסחרי. שימוש כזה כרוך בסיכון משפטי, אלא אם פונים ליוצרי המאגר ומבררים את תנאי ההפצה המקוריים. לא הייתי מכניס את הנתונים לציר אימון של מוצר מסחרי במצב הנוכחי.

האם המאגר כולל נתונים בעברית?

לא, המאגר כולל אך ורק אנגלית, סינית פשוטה וסינית מסורתית. אם אתם מכוונים למערכת רפואית בישראל, תצטרכו לתרגם את השאלות או לחפש מקורות מקומיים. המבנה עצמו יכול לשמש תבנית לבניית מאגר דומה בארץ.

איך השאלות והתשובות נאספו במקור?

הנתונים נאספו ישירות מתוך מבחני הסמכה רפואיים מקצועיים שנערכו בארצות הברית ובסין. לצד בחינות אלה, החוקרים אספו ספרי לימוד רפואיים גדולים כדי לספק את הרקע העובדתי לפתרון השאלות. התוצאה היא שאלות אותנטיות שנכתבו בידי מומחים עבור רופאים לעתיד.

מה ההבדל בין התצורות השונות של הקבצים במאגר?

המאגר מציע חלוקה לפי שפות וגם לפי פורמט הנתונים, כמו פורמט המקור מול פורמט אחיד של bigbio qa. בנוסף קיימת חלוקה לפי מספר המסיחים, למשל גרסה מותאמת של ארבע אפשרויות בחירה לכל שאלה. אפשר לבחור את התצורה שמתאימה ישירות למבנה הקלט של המודל שלכם.

איך טוענים

הנתונים מגיעים בקובצי parquet ומחולקים לתיקיות לפי שפה, פורמט מקור ופורמט bigbio qa. המאגר ציבורי ופתוח להורדה ישירה בלי צורך בהרשאת גישה מיוחדת, וכולל 44 קבצים. לפני שמתחילים לעבוד, תצטרכו לבחור את התצורה המדויקת של מספר המסיחים, כמו גרסת ארבע האפשרויות, ולוודא שאתם טוענים את שדות השאלה, האפשרויות והתשובה הנכונה מהמבנה הרצוי.

from datasets import load_dataset

ds = load_dataset("bigbio/med_qa")

הרישיון

הרישיון המדווח במאגר מוגדר כלא ידוע. המשמעות היא שאין היתר שימוש ברור ומפורש לפרויקטים מסחריים, ואי אפשר לדעת בוודאות מה מותר לעשות עם מודל שאומן על הנתונים. אם אתם בונים מוצר מסחרי, לא הייתי נוגע בזה בלי בדיקה משפטית של המקור בגיטהאב או פנייה ישירה ליוצרים.

הרישיון המלא ב־Hugging Face ↗