GPT
R

RadGenome-ChestCT

קוד פתוח

RadGenomecc-by-4.02024-05-04

המאגר מחבר בין סריקות סיטי חזה תלת ממדיות לבין מסכות סגמנטציה וטקסט רפואי מקושר. הוא מיועד למי שבונה מודלים שמסבירים ממצאים רדיולוגיים לפי אזור ספציפי בתמונה.

  • 46,223הורדות בחודש
  • 63לייקים

מה זה

הנתונים מתבססים על מאגר המקור CT-RATE, שכולל יותר מ־25,692 סריקות סיטי חזה ללא חומר ניגוד מ־20,000 מטופלים, יחד עם הדוחות הרדיולוגיים שלהם. היוצרים השתמשו במודלי שפה ובמודלי סגמנטציה כדי להרחיב את המידע הגולמי לשלושה רכיבים מרכזיים. הרכיב הראשון הוא מסכות סגמנטציה ברמת האיבר שמכסות 197 קטגוריות שונות.

הרכיב השני כולל 665 אלף דוחות מקושרים ברמות פירוט שונות, שבהם כל משפט בדוח מוצמד ישירות לאזור האנטומי המתאים בסריקה באמצעות מסכה. הרכיב השלישי מכיל 1.3 מיליון זוגות של שאלות ותשובות ויזואליות שגם הם מקושרים למסכות סגמנטציה. כל הדוחות והשאלות בסט הוולידציה עברו בדיקה ידנית של אדם כדי לוודא את הדיוק שלהם.

מתאים ל

  • אימון VQA רפואי מבוסס ראיות

    לימוד מודלים לענות על שאלות קליניות לגבי סריקות סיטי חזה תוך הצבעה על האזור האנטומי המדויק.

  • יצירת דוחות מונחית אזור

    הפקת טקסט רדיולוגי אוטומטי שמתאר ממצאים ספציפיים על בסיס מסכות סגמנטציה של איברים.

  • סגמנטציה של איברי חזה

    זיהוי וחלוקה של 197 קטגוריות אנטומיות בסריקות תלת ממדיות ללא חומר ניגוד.

איפה זה נופל

כל הסריקות מגיעות ממקור יחיד ומבוססות על בדיקות ללא חומר ניגוד בלבד, כך שהן לא מתאימות לאימון מודלים שמיועדים לפענח בדיקות עם הזרקה. בנוסף, רוב התיוגים, הדוחות המקושרים והשאלות נוצרו בעזרת מודלים אוטומטיים. רק סט הוולידציה עבר אימות אנושי ידני, ולכן סט האימון עלול להכיל הזיות של מודלי שפה או שגיאות סגמנטציה. הטקסט כולו באנגלית ואין כאן מידע בעברית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא. עליכם רק לציין את הקרדיט ליוצרים ולמאמרים המקוריים כפי שהם מבקשים.

האם הדאטהסט כולל נתונים בעברית?

לא. כל הדוחות, השאלות והתשובות מנוסחים באנגלית בלבד. אם המטרה היא מערכת לבתי חולים בארץ, תצטרכו לתרגם את המונחים או להתאים אותם לטרמינולוגיה מקומית.

במה הוא שונה מ־CT-RATE הרגיל?

הוא מרחיב את המאגר המקורי על ידי הוספת 197 קטגוריות של מסכות סגמנטציה. בנוסף, הוא מקשר כל משפט בדוח וכל שאלת ויז'ואל ישירות לאזור הספציפי בסריקה.

האם כל המידע עבר בדיקה של רדיולוגים?

לא כולו. הקישורים והשאלות נוצרו בעזרת מודלי סגמנטציה ומודלי שפה גדולים. רק הדוחות והשאלות שנמצאים בסט הוולידציה עברו בדיקה ואימות ידניים.

איך טוענים

המאגר מחזיק 25,723 קבצים וכולל תבניות ג'ייסון עבור שאלות ותשובות לפי נושאים כמו אבנורמליות, מחלות, מיקום, נוכחות וגודל, לצד קובצי סי אס וי כמו train region report שמכילים את הקשר בין הטקסט לאזורים. כדי להתחיל לעבוד צריך לתכנן מראש את נפח האחסון והעיבוד, כי מדובר בנתוני סריקות תלת ממד ומסכות סגמנטציה רבות, ולא רק בטבלאות טקסט קלות. אין דרישה לאישור גישה מיוחד לפי הפרטים שפורסמו.

from datasets import load_dataset

ds = load_dataset("RadGenome/RadGenome-ChestCT")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, כולל אימון מודלים שיוטמעו במוצרים סגורים. התנאי היחיד הוא מתן קרדיט ברור למחברים וציון המקורות המבוקשים לפי תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗