GPT
C

CT_DeepLesion-MedSAM2

קוד פתוח

wanglabרישיון לא דווח2025-04-02

  • medical

המאגר מכיל אלפי סריקות CT עם תיוגי נגעים שנוצרו באמצעות MedSAM2. הוא מיועד למי שמפתח מודלים לסגמנטציה רפואית בתלת מימד וזקוק למידע מבוסס DeepLesion.

  • 9,082הורדות בחודש
  • 19לייקים

מה זה

בבסיס הפרויקט עומד מאגר DeepLesion המקורי של מכוני הבריאות הלאומיים בארצות הברית, שכולל במקור מעל שלושים ושניים אלף נגעים שונים שנלקחו מתוך יותר מעשרת אלפים בדיקות CT של אלפי חולים. בכל בדיקה כזו סומנו בעבר קופסאות תוחמות על גבי פרוסות המפתח של הסריקה, בהתבסס על מדידות רדיולוגיות שגרתיות של הקוטר הארוך והקוטר האנכי לו.

החוקרים של מעבדת וואנג לקחו את הנתונים האלה ויצרו תיוגי סגמנטציה מפורטים לחמשת אלפים נגעים מתוכם. התהליך התבסס על מודל MedSAM2 בתהליך ששילב בדיקה אנושית, כלומר הצעות המודל נבחנו ותוקנו בידי אדם כדי להבטיח איכות תיוג גבוהה. המאגר מכיל קובצי מידע ומטא נתונים בפורמט טבלאי לצד קובצי נפח רפואיים, ומספק חלוקת אימון מוכנה לעבודה על משימות סגמנטציה מורכבות של נגעים באיברים שונים בגוף.

מתאים ל

  • אימון סגמנטציה בסיטי

    אימון וכיול של מודלים מבוססי ראייה ממוחשבת לזיהוי ותחימת נגעים רפואיים בנפחי CT תלת מימדיים.

  • הערכת ביצועי מודלים

    בנצ'מרק להערכת מודלי פילוח רפואיים מול חמשת אלפים נגעים שעברו אימות אנושי.

  • התאמת MedSAM2

    המשך אימון או התאמה אישית של רשתות סגמנטציה ספציפיות על פרוטוקולי סריקה מגוונים.

איפה זה נופל

התיוגים אמנם עברו תיקוף אנושי, אך נקודת המוצא שלהם היא פלט של MedSAM2 ולא תחימה ידנית מלאה של מומחה רדיולוגיה מהשלב הראשון. מעבר לכך, המאגר מתמקד בנגעים ספציפיים שהיו מתועדים בבדיקות המקוריות של DeepLesion, ולכן הוא לא מייצג את כל סוגי הפתולוגיות או את כל פרוטוקולי הסריקה הקיימים בבתי חולים בישראל. הנתונים מתועדים באנגלית בלבד, ואין תיעוד לגבי חלוקה דמוגרפית מלאה או פיזור מדויק בין יצרני סורקים שונים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

נכון לעכשיו לא פורסם רישיון בדף המאגר, ולכן מבחינה משפטית אין אישור לשימוש מסחרי. מעבר לכך צריך לבדוק את תנאי המקור של DeepLesion. אם אתם בונים מוצר לחברה, עדיף לפנות לצוות המחקר של מעבדת וואנג לפני השימוש.

באילו פורמטים הקבצים שמורים בפועל?

הנתונים כוללים קובץ מטא נתונים מרכזי מסוג DeepLesion_Dataset_Info.csv עם פרטי המקרים והנגעים. סריקות הדימות עצמן שמורות כקובצי תמונה רפואיים דחוסים בפורמט NIfTI בסיומת nii.gz. כדי לעבוד איתם בפייתון תצטרכו להשתמש בספריות מתאימות לדימות רפואי.

מאיפה הגיעו התיוגים של הנגעים?

הסריקות נלקחו ממאגר DeepLesion של המכונים הלאומיים לבריאות, שכלל במקור קופסאות תוחמות וקטרים. על בסיס הנתונים האלה, החוקרים הפעילו את MedSAM2 כדי לייצר מסיכות סגמנטציה לחמשת אלפים נגעים, ולאחר מכן ביצעו תיקוף ודיוק בעזרת גורם אנושי בתהליך של human-in-the-loop.

האם יש במאגר תמיכה בנתונים בעברית?

לא, כל המטא נתונים, התיעוד וקבצי הטבלאות שמורים באנגלית בלבד. מכיוון שמדובר בעיקר בסריקות CT תלת מימדיות, התוכן החזותי אינו תלוי שפה, אך אין שום שדות טקסטואליים מקומיים או התייחסות למערכות רפואיות ישראליות.

איך טוענים

הטעינה מתבצעת ישירות בפייתון דרך ספריית datasets באמצעות פקודת load_dataset עם המזהה wanglab/CT_DeepLesion-MedSAM2, ומשם ניגשים ישירות לפיצול האימון. אין צורך בתהליך אישור גישה מוקדם או בהרשמה ידנית מיוחדת כדי למשוך את הנתונים מהשרתים.

המאגר מכיל 13,949 קבצים, שכוללים קובץ מידע מרכזי בפורמט DeepLesion_Dataset_Info.csv לצד אלפי סריקות תלת מימדיות דחוסות בסיומת nii.gz. לפני שמתחילים להוריד, קחו בחשבון שמדובר בהיקף גדול של נתונים בינאריים כבדים שמצריכים נפח אחסון מקומי משמעותי וספריות לעיבוד תמונה רפואית כמו SimpleITK או nibabel לצורך פריקת הנפחים וקריאת התוויות.

from datasets import load_dataset

ds = load_dataset("wanglab/CT_DeepLesion-MedSAM2")

הרישיון

בעמוד הדאטהסט לא דווח רישיון כלל. המצב הזה מציב סיכון משפטי ברור, שכן ללא רישיון מפורש אין הרשאה חוקית להשתמש בנתונים למטרות מסחריות או להפיץ מודלים שנגזרו מהם. בנוסף, המקור המקורי DeepLesion עשוי להטיל מגבלות שימוש משלו שחובה לבדוק. החוקרים מבקשים לצטט את המאמר של MedSAM2 ואת המאמר המקורי של DeepLesion בכל עבודה אקדמית, אך עבור יישום מסחרי לא הייתי נוגע בזה לפני קבלת הבהרה רשמית מהיוצרים.

הרישיון המלא ב־Hugging Face ↗