GPT
N

ncbi_disease

קוד פתוח

ncbiunknown2022-03-02

מאגר מתויג ידנית של אזכורי מחלות מתוך מאות תקצירי מאמרים רפואיים. הוא מתאים למי שבונה מודל לזיהוי ישויות בטקסט קליני ומחקרי.

  • 3,022הורדות בחודש
  • 53לייקים

מה זה

המאגר כולל 793 תקצירי מחקר מתוך PubMed, שמחולקים ברמת המשפטים לסך של אלפי דוגמאות. כל רשומה כוללת מזהה משפט, רשימת מילים ותגיות מספריות שמסמנות אם מילה מסוימת היא חלק משם של מחלה או לא.

איסוף המידע התבסס על ספרות רפואית, כאשר צוות של 14 מומחים מנוסים במידענות ביו-רפואית תייג את הטקסטים ידנית בשני שלבים. המתייגים עבדו בזוגות שהוגרלו מראש כדי לצמצם הטיות, נעזרו במערכת PubTator עם תיוג אוטומטי מוקדם, ופתרו מחלוקות בהסכמה תוך קישור לקטלוגים הרפואיים MeSH ו־OMIM.

הנתונים כבר מחולקים מראש לשלושה חלקים. סט האימון כולל 5,433 משפטים, סט האימות כולל 924 משפטים, וסט הבחינה מכיל 941 משפטים.

מתאים ל

  • אימון זיהוי ישויות

    לימוד מודלים לזהות שמות של מחלות מתוך טקסטים מדעיים רפואיים.

  • בנצ'מרק למודלי שפה

    השוואת ביצועים על סט המבחן המובנה מול תוצאות עבר שפורסמו.

  • סינון ספרות מחקרית

    שליפת מאמרים רלוונטיים לפי שמות מחלות שמופיעים בתקצירים.

איפה זה נופל

הטקסט כולו באנגלית מדעית של תקצירי מחקר, בלי ייצוג לעברית ובלי שפה מדוברת או תיקים רפואיים גולמיים. המתייגים ראו מראש הצעות של מערכת אוטומטית שסיפקה ציוני ביטחון, עובדה שעלולה להכניס הטיה שיטתית לתיוג האנושי.

חלק משמות המחלות במקור לא התאימו לקטלוגים הרגילים, ולכן נדרשו התאמות ידניות מיוחדות. אם המטרה שלכם היא לפעול על נתוני אמת קליניים מקומיים, הפער בניסוח ובמונחים יחייב בדיקה מעמיקה והתאמות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון בעמוד מוגדר כלא ידוע, ולכן אין אישור מפורש לשימוש מסחרי. לפני שמשלבים את המידע באימון מודל שמיועד למוצר, צריך לברר את תנאי השימוש מול מחברי המאגר המקוריים ב־NCBI. שימוש בלי בדיקה כזו חושף אתכם לסיכון של הפרת זכויות יוצרים.

האם יש במאגר תמיכה בעברית?

המאגר כולל טקסטים באנגלית בלבד שנלקחו מתקצירים רפואיים של PubMed. אין בו נתונים בעברית ולא נעשה בו תיוג של שפות אחרות. מודל שיאומן עליו בלבד לא יזהה מחלות בטקסטים בעברית.

כמה המאגר שוקל והאם הוא דורש משאבים כבדים?

מדובר באוסף קל מאוד שכולל בסך הכל 793 תקצירים המחולקים לכ־7,300 משפטים. הקבצים יורדים תוך שניות בודדות ולא דורשים נפח אחסון מיוחד. אפשר להריץ עליו אימון ובדיקות על מעבד גרפי סטנדרטי בלי שום בעיה.

איך נוצרו התיוגים ומה רמת האמינות שלהם?

כל תקציר תויג בידי שני מומחים שונים מתחום המידענות הביו-רפואית מתוך צוות של 14 בודקים. הם נעזרו בכלי עזר ממוחשב והגיעו להסכמה משותפת במקרי מחלוקת. בנוסף, בוצעה בדיקת עקביות רוחבית על פני כל הטקסטים כדי לוודא איכות גבוהה.

איך טוענים

טוענים את המידע דרך ספריית הדאטהסטים הפתוחה, בלי צורך באישור גישה מיוחד או בהרשמה מראש. הקבצים כוללים קוד פייתון ייעודי וקובץ הסבר, וההורדה קטנה מאוד ומהירה כיוון שמדובר בטקסט נקי של כמה אלפי משפטים בלבד.

הרשומות מגיעות מחולקות למילים בתוך המפתח tokens, ומסומנות במקביל במפתח ner_tags. הערך 0 מציין מילה רגילה, 1 מסמן תחילת שם של מחלה, והערך 2 ניתן למילים הבאות באותו ביטוי. אין פה חלוקה מורכבת לעשרות סוגי ישויות, אלא פורמט ישיר שמתאים ישר להזנה למודלי שפה.

from datasets import load_dataset

ds = load_dataset("ncbi/ncbi_disease")

הרישיון

הרישיון הרשמי מוגדר כלא ידוע בעמוד המאגר, ולכן אין היתר שימוש ברור ומפורש. במצב כזה אי אפשר להניח שמותר להשתמש במידע לפיתוח מוצרים מסחריים, ויש סכנה משפטית בהפצת מודל שאומן עליו. חובה לפנות למפרסמים או לבדוק את תנאי המקור של המאמר לפני כל שימוש שחורג ממחקר אקדמי סגור.

הרישיון המלא ב־Hugging Face ↗