GPT
P

pubmed_qa

קוד פתוח

bigbiomit2022-11-13

שאלות מחקר ביו רפואיות עם תשובות של כן, לא או אולי מתוך תקצירי מאמרים. המאגר נבנה כדי לבחון הסקת מסקנות והבנת נתונים כמותיים במחקר רפואי.

  • 6,870הורדות בחודש
  • 59לייקים

מה זה

המאגר מכיל שאלות מחקר שמבוססות על כותרות של מאמרים רפואיים, יחד עם התקציר המקורי מתוך פאבמד שממנו הוסרה פסקת המסקנות. כל דוגמה כוללת תשובה ארוכה שהיא המסקנה המקורית של המאמר, ותשובה קצרה מסוג כן, לא, או אולי, שמסכמת אותה.

הנתונים מחולקים לשלושה חלקים שונים לפי אופן היצירה שלהם. החלק הראשון כולל 1k דוגמאות שתויגו ידנית בידי מומחים. החלק השני מכיל 211.3k דוגמאות שנוצרו אוטומטית באמצעות היוריסטיקה פשוטה שחילצה שאלות ותיוגי כן ולא ישירות מכותרות. החלק השלישי מורכב מ 61.2k זוגות של שאלות והקשרים ללא תיוג של תשובות.

מתאים ל

  • הערכת מודלים רפואיים

    בדיקת יכולת המודל לענות כן או לא על שאלות מחקר מתוך תקצירים רפואיים.

  • אימון מקדים על טקסט רפואי

    שימוש במאות אלפי הדוגמאות הלא מתויגות והמלאכותיות ללמידה ביו רפואית.

  • חילוץ מסקנות אוטומטי

    בניית מודל שמייצר את פסקת המסקנה מתוך גוף התקציר בלבד.

איפה זה נופל

הטקסטים כולם באנגלית בלבד ואין כאן עברית. רוב החומר המתוייג, בהיקף של 211.3k דוגמאות, נוצר באופן מלאכותי באמצעות היוריסטיקה פשוטה ולא בידי אדם, מה שעלול להכניס שגיאות לוגיות. בנוסף, יש רק 1k דוגמאות מאומתות בידי מומחים, וזה מעט מאוד לאימון מודלים כבדים מאפס ללא הסתמכות על החלק המלאכותי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר מופץ תחת רישיון MIT. הרישיון מאפשר שימוש מסחרי מלא, כולל אימון מודלים שיימכרו ללקוחות, כל עוד שומרים על תנאי הייחוס של הרישיון.

האם יש במאגר שאלות או תקצירים בעברית?

לא. המאגר מוגדר כשפת מקור אנגלית בלבד ומבוסס כולו על תקצירים מתוך פאבמד שנכתבו באנגלית. אם המוצר שלכם מיועד לעברית, תצטרכו לתרגם את הנתונים באופן עצמאי.

כמה דוגמאות אמינות באמת יש שם לאימון?

יש רק 1k דוגמאות שתויגו בידי מומחים. שאר הדאטה כולל 211.3k דוגמאות שנוצרו אוטומטית בעזרת היוריסטיקה ועוד 61.2k דוגמאות ללא תיוג בכלל.

איך טוענים

טוענים את המאגר ישירות דרך פייתון עם ספריית הדאטהסטס או סקריפט הטעינה של ביגביו. הגישה ציבורית לחלוטין ואין צורך בהרשמה או באישור מקדים. הקבצים שמורים במבנה של קובצי זיפ עבור כל פיצול, והשדות העיקריים שצריך לחלץ הם השאלה, ההקשר הרפואי, התשובה הארוכה והתיוג הסופי.

from datasets import load_dataset

ds = load_dataset("bigbio/pubmed_qa")

הרישיון

הרישיון הוא רישיון MIT. הוא מתיר שימוש מסחרי חופשי, שינוי של המידע ושילוב שלו בקוד סגור, בלי דרישה לשתף את התוצרים באותו רישיון. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית והפניה למפרסמים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗