GPT
N

NIH-Chest-X-ray-dataset

קוד פתוח

alkzar90unknown2022-09-30

מאגר ענק של 112,120 צילומי חזה רפואיים קדמיים עם תיוגים מרובים ל־14 מחלות שונות. הוא מאפשר לאמן מודלים לזיהוי פתולוגיות נפוצות בריאות על בסיס נתונים קליניים בהיקף נרחב.

  • 11,582הורדות בחודש
  • 61לייקים

מה זה

המאגר כולל צילומי רנטגן חזיתיים מ־30,805 מטופלים שונים. כל רשומה כוללת תמונת PNG בגודל 1024x1024, נתיב מקומי לקובץ, ומערך של תוויות מספריות המייצגות את המחלות שאותרו בצילום. מתוך סך התוויות, מצב ללא ממצאים הוא הנפוץ ביותר ומופיע ב־60,361 מקרים.

התיוגים לא נוצרו בידי רדיולוגים שסימנו ידנית כל תמונה במאגר הזה, אלא נשלפו אוטומטית מדוחות טקסטואליים באמצעות עיבוד שפה טבעית. הדוחות הרפואיים המקוריים עצמם אינם נכללים מטעמי פרטיות. החלוקה המובנית כוללת 86,524 צילומים בסט האימון ו־25,596 בסט הבדיקה, כשלחלק קטן מהתמונות מצורפים גם קובצי תיחום מלבניים מגרסת 2017.

מתאים ל

  • אימון סיווג מרובה תוויות

    זיהוי בו-זמני של 14 מחלות ריאה בצילומי רנטגן חזיתיים על בסיס דגימות מרובות מטופלים.

  • בדיקת אלגוריתמי איתור

    הערכת ביצועי מודלים למיקום ממצאים בחלל החזה באמצעות קובצי התיחום המצורפים לחלק מהדגימות.

  • למידה עם תיוג חלש

    מחקר על התמודדות מודלים עם תוויות רועשות שמקורן בחילוץ טקסטואלי אוטומטי.

איפה זה נופל

התיוג מבוסס טקסט אוטומטי, והיוצרים מציינים דיוק צפוי של מעל תשעים אחוזים בלבד. זה אומר שיש אחוז שגיאה מובנה בתיוגים עצמם עוד לפני שהתחלתם לאמן. בנוסף קיים חוסר איזון חריף בין המחלקות: בעוד שתפליט ריאתי ותסנין מופיעים בעשרות אלפי מקרים, בקע מופיע רק ב־227 מקרים בכל המאגר. לא הייתי בונה על זה מערכת קלינית בלי אימות ידני על דאטה חיצוני.

שאלות
נפוצות

האם המאגר כולל עברית או התאמה לאוכלוסייה בישראל?

לא. המאגר נאסף בארצות הברית והדוחות הרפואיים המקוריים עובדו באנגלית בלבד. הנתונים לא משקפים חלוקה דמוגרפית ישראלית או התפלגות מקומית של מחלות.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הטקסט בכרטיס מציין שאין מגבלות על השימוש בתמונות, כל עוד עומדים בדרישות הייחוס. עם זאת, בגלל שהרישיון הרשמי מוגדר כלא ידוע במערכת, צוותים משפטיים יעדיפו לוודא את תנאי המקור של NIH.

איך הופקו תוויות המחלה של הצילומים?

התוויות חולצו מתוך דוחות פענוח רדיולוגיים קיימים באמצעות מודל עיבוד שפה טבעית. רופאים לא עברו ידנית על כל 112,120 התמונות כדי להצמיד להן תוויות ספציפיות למאגר הזה.

האם הדוחות הרפואיים המלאים זמינים לקריאה?

לא, הדוחות המקוריים הוסרו ולא שותפו מסיבות של הגנת פרטיות וחיסיון רפואי. המאגר מספק רק את התמונות ואת התוויות הסופיות שחולצו מהם.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה באמצעות קריאה למזהה alkzar90/NIH-Chest-X-ray-dataset. אין צורך באישור גישה מראש. הקבצים מחולקים למספר קובצי zip המכילים תמונות ברזולוציה מלאה, ולכן ההורדה והחילוץ דורשים נפח אחסון משמעותי וזמן פענוח. בעת שליפת נתונים, יש לפנות קודם לאינדקס הדגימה ורק אז לשדה התמונה, כדי למנוע פענוח כבד ומיותר של כל התמונות בזיכרון בבת אחת.

from datasets import load_dataset

ds = load_dataset("alkzar90/NIH-Chest-X-ray-dataset")

הרישיון

לפי כרטיס המאגר אין מגבלות על השימוש בתמונות, אך נדרש ייחוס ברור. יש לקשר לאתר ההורדה של NIH, לצטט את מאמר CVPR מ־2017, ולציין שהמרכז הקליני של NIH הוא מקור הנתונים. המטא-דאטה בהאגינג פייס מוגדר כ־unknown, אך ההוראות בפנים מאפשרות עבודה חופשית תחת הקרדיט הנדרש.

הרישיון המלא ב־Hugging Face ↗