GPT
P

PubMedQA

קוד פתוח

qiaojinmit2022-03-02

שאלות מחקר ביו רפואיות עם תשובות סגורות של כן, לא או אולי על בסיס תקצירים מדעיים. מתאים למי שבונה מודל להסקה קלינית ומחפש בנצ'מרק ממוקד.

  • 91,393הורדות בחודש
  • 340לייקים

מה זה

המאגר מכיל שאלות מחקר מדעיות שנלקחו מתוך תקצירים רפואיים, כשהמטרה היא לענות עליהן באמצעות אחת משלוש תוויות: כן, לא, או אולי. לפי מבנה הקבצים, הנתונים מחולקים לשלושה חלקים שונים: חלק מתויג, חלק לא מתויג, וחלק סינתטי שנוצר באופן מלאכותי. מתוך החלק המתויג, חמש מאות שאלות משמשות כסט המבחן הרשמי של המאגר.

כרטיס הנתונים לא מפרט כיצד בוצע הסינון המדויק או מי היו המתייגים, אך מציין שהנתונים מבוססים על ספרות ביו-רפואית מאתר פאבמד. סך כל הרשומות בכל החלקים יחד נע בין מאה אלף למיליון רשומות, מה שמעיד על כך שעיקר הנפח מורכב מהדוגמאות הסינתטיות או הלא מתויגות ולא מהתיוג האנושי הישיר.

מתאים ל

  • הערכת ביצועי מודל שפה

    בדיקת יכולת המודל לענות בכן, לא או אולי על שאלות מדעיות מורכבות לפי תקציר נתון.

  • אימון מקדים על טקסט רפואי

    שימוש במאות אלפי הדוגמאות הלא מתויגות והסינתטיות לצורך אימון המשך בתחום מדעי החיים.

  • אימון מסווגים להסקה לוגית

    כוונון עדין של מודלים קטנים לסיווג טקסט רפואי לשלוש רמות ודאות על בסיס ראיות.

איפה זה נופל

הכרטיס מודה מפורשות שהנתונים קיימים באנגלית בלבד, כך שאין שום תמיכה מובנית בעברית או במינוח רפואי מקומי. מעבר לכך, מרבית השדות הטכניים בכרטיס הושארו ריקים, כולל דיונים על הטיות, איסוף המידע ופרטיות. סט הבדיקה כולל חמש מאות שאלות בלבד, מדגם קטן יחסית שעלול לייצר רעש במדידת ביצועים. אי אפשר לדעת מהכרטיס עד איזו שנה נאספו התקצירים, מה שמחייב בדיקה של התאמת הידע לפרוטוקולים רפואיים עדכניים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא MIT ולכן אין מניעה חוקית לשלב אותו בפרויקטים מסחריים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים המקורית של היוצרים בקוד או בהפצה. המודל שתאמנו לא מושפע ממגבלות של קוד פתוח מדבק.

האם יש במאגר שאלות או תקצירים בעברית?

לא, המאגר מוגדר כדובר אנגלית בלבד. כל המידע נאסף מספרות ביו-רפואית בינלאומית שפורסמה באנגלית. אם אתם צריכים יישום בעברית, תידרשו לתרגם את הנתונים או לאסוף מידע ממקורות מקומיים.

מה ההבדל בין החלקים השונים בקבצי הנתונים?

המאגר מפוצל לשלושה קבצים שכוללים נתונים מתויגים, נתונים לא מתויגים ונתונים סינתטיים שנוצרו במחשב. החלק המתויג קטן ומכיל בין היתר חמש מאות שאלות מבחן, בעוד שאר החלקים מכילים עשרות עד מאות אלפי דוגמאות. חשוב לבחור את הקובץ המתאים כדי לא להעריך מודל על נתונים סינתטיים במקום על תיוג אנושי.

איך טוענים

טוענים את המאגר ישירות בספריית הדאטהסטס מבית האגינג פייס לפי המזהה, ללא צורך באישור גישה מוקדם או בחתימה על הסכמי סודיות. הנתונים שמורים בחמישה קבצים בפורמט פארקט יעיל, שמחולקים לפי הפיצולים של מתויג, לא מתויג ומלאכותי. לפני שטוענים הכל לזיכרון, כדאי להחליט באיזה פיצול משתמשים כדי לא להעמיס מאות אלפי רשומות סינתטיות כשרוצים רק להעריך על סט המבחן. השדות החשובים לעבודה כוללים את שאלת המחקר, טקסט התקציר הרפואי שממנו צריך להסיק את המסקנה, ואת התווית הסופית בדוגמאות המתויגות.

from datasets import load_dataset

ds = load_dataset("qiaojin/PubMedQA")

הרישיון

המאגר מפורסם תחת רישיון MIT, שמאפשר שימוש מסחרי, שינוי, הפצה ושילוב בקוד סגור כמעט ללא הגבלות. נדרש רק לשמור על הודעת זכויות היוצרים ונוסח הרישיון המקורי. הרישיון לא דורש שיתוף באותו רישיון, ומודלים שאומנו על הנתונים אינם מחויבים להיפתח לציבור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗