GPT
R

ROCOv2-radiology

קוד פתוח

eltoriocc-by-nc-sa-4.02024-11-11

  • medical

מאגר של תמונות רדיולוגיה עם כיתובים ומושגים רפואיים ממאמרים פתוחים. מתאים למי שרוצה לאמן מודלים מולטימודליים על דימות רפואי בלי להתעסק בסינון ידני של מאמרים.

  • 1,850הורדות בחודש
  • 90לייקים

מה זה

הנתונים כוללים כמעט שמונים אלף תמונות דימות שנלקחו ממאמרי גישה חופשית ב־PubMed Central. לכל תמונה מוצמד כיתוב מקורי באנגלית ורשימת מושגים מתוך המילון הרפואי UMLS. החלוקה המקורית מפרידה את החומר לאימון עם כמעט שישים אלף דוגמאות, וולידציה ובדיקה עם קרוב לעשרת אלפים תמונות בכל חלק.

היוצרים הורידו את המאמרים ב־FTP, שלפו תמונות והפעילו שני מסווגים כדי לסנן תרשימים שאינם רדיולוגיה או איורים מורכבים. משם הוציאו כפילויות, כיתובים קצרים מדי וכאלה שאינם באנגלית. המושגים הרפואיים חולצו בכלי האוטומטי MedCAT, לצד אנוטציה ידנית למודליות הדימות, לאזור הגוף ולזווית הצילום ברנטגן.

מתאים ל

  • אימון מודלי יצירת כיתוב

    חיבור תמונות רנטגן או סיטי לטקסט תיאורי כדי לבנות מודלים שמנסחים ממצא ראשוני.

  • סיווג רפואי מרובה תוויות

    זיהוי מושגי UMLS ישירות מתוך התמונה לפי כמעט אלפיים מזהים שונים.

  • אחזור תמונות לפי טקסט

    חיפוש דוגמאות רדיולוגיות רלוונטיות במאגר לפי תיאור קליני חופשי באנגלית.

איפה זה נופל

התמונות הגיעו מפרסומים מדעיים ולא ממערכות בית חולים, ולכן הן עוברות דחיסה, חיתוך ועיבוד שאינם מייצגים קבצי DICOM גולמיים. בנוסף, חילוץ המושגים התבסס ברובו על כלי אוטומטי ומודלים מסווגים עם דיוק של תשעים אחוזים, מה שמשאיר שגיאות תיוג. כל הכיתובים באנגלית בלבד, כך שאין כאן התאמה לשפה אחרת או למונחים מקומיים בלי תרגום נוסף.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון אוסר זאת מפורשות. הוא מוגדר כ־CC BY-NC-SA 4.0 ומיועד אך ורק למחקר או שימוש לא מסחרי. מודל שתאמנו על החומר הזה מוגבל באותם תנאים בדיוק.

האם הדאטהסט כולל טקסטים או כיתובים בעברית?

לא, כל המאגר באנגלית. שלב הסינון של היוצרים הסיר במכוון כל כיתוב שלא נכתב באנגלית. אם אתם צריכים נתונים בעברית, תצטרכו לתרגם את הטקסטים בעצמכם.

מאיפה הגיעו התמונות ואיך הן עברו סינון?

המקור הוא תמונות מתוך מאמרים פתוחים במאגר PMC. החוקרים הורידו את הפרסומים והשתמשו בשני מודלים אוטומטיים של סיווג כדי לזרוק תמונות שאינן רדיולוגיה או איורים מרובי חלקים, לצד סינון של כפילויות ורישיונות לא מתאימים.

איך טוענים

החומר מחולק ל־42 קבצי Parquet ישירות ב־Hugging Face Hub, וטוענים אותו בספריית datasets הרגילה של פייתון בלי צורך באישור גישה מראש. השדות כוללים את התמונה, הכיתוב הטקסטואלי ומזהי המושגים הרפואיים. סט האימון לבדו מחולק לעשרים ושבעה קבצים, כך ששווה להזרים אותו אם חסר לכם זיכרון עבודה מקומי.

from datasets import load_dataset

ds = load_dataset("eltorio/ROCOv2-radiology")

הרישיון

הרישיון הוא CC BY-NC-SA 4.0. המשמעות ברורה: שימוש מסחרי אסור לגמרי, גם אם מוכרים שירות וגם אם מוכרים מודל שאומן על הנתונים. חובה לתת קרדיט ליוצרים, וכל נגזרת או דאטהסט משופר חייבים להתפרסם בדיוק תחת אותו רישיון.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗