GPT
C

CVPR-BiomedSegFM

קוד פתוח

junmacc-by-nc-sa-4.02025-04-17

  • medical
  • biomedical
  • 3d
  • cvpr2025

המאגר מרכז עשרות אלפי סריקות רפואיות תלת ממדיות בחמישה אופני דימות עבור סגמנטציה. הוא נבנה לתחרות CVPR 2025 כדי לפתח מודלי יסוד מונחי אינטראקציה או טקסט.

  • 39,963הורדות בחודש
  • 24לייקים

מה זה

הנתונים מגיעים ממאגרים ציבוריים שונים שמאפשרים הפצה מחדש, ומכסים סריקות CT, MRI, PET, אולטרסאונד ומיקרוסקופיה. כדי לצמצם נפח אחסון, המארגנים חתכו רק את הפרוסות המתויגות ושמרו אותן כקובצי npz אחידים. כל קובץ אימון מכיל מערך תלת ממדי של התמונה עם ערכי פיקסלים בין 0 ל־255, מסכת אמת מידה ומרווחי סריקה.

המבנה מחולק לתיקיית אימון מלאה עם עשרות אלפי קבצים, לצד תת קבוצה אקראית של עשרה אחוזים ששוקלת כ־16 גיגה בייט ומיועדת לעבודה מהירה. ישנן גם תיקיות ולידציה שבהן התמונות מופרדות ממסכות האמת, וקובץ ג'ייסון ייעודי שמספק הנחיות טקסטואליות עבור משימת הסגמנטציה מונחית הטקסט.

מתאים ל

  • אימון סגמנטציה אינטראקטיבי

    פיתוח מודלים מבוססי נקודות או תיבות תוחמות לזיהוי איברים ונגעים בסריקות רפואיות.

  • סגמנטציה מונחית טקסט

    שילוב הנחיות שפה טבעית באנגלית כדי לחלץ מסכות סמנטיות או מסכות מופעים מתוך הסריקות.

  • אימון על משאבים מוגבלים

    שימוש בתת הקבוצה של 10 האחוזים ששוקלת 16 גיגה לצורך בדיקת ארכיטקטורות מהירה.

איפה זה נופל

חלק מהמטרות, כמו כלי דם בנגעי מוח של BraTS, לא כוללות תיבות תוחמות מובנות כי המבנה שלהן מורכב מדי, מה שמחייב שימוש בנקודות במקום קופסאות. בנוסף, קובצי טקסט לא קיימים עבור כלל הנתונים וצריך לסנן מקרים חסרים באופן ידני באימון מונחה שפה. הנתונים גם אינם סריקות גוף מלאות אלא פרוסות חתוכות מראש לפי תיוג, ולכן הם לא משקפים התפלגות קלינית מלאה של סריקה גולמית בבית חולים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון המוגדר הוא cc-by-nc-sa-4.0 שאוסר שימוש מסחרי מכל סוג. כל פיתוח שמתבסס עליו מחייב גם שיתוף של התוצרים תחת אותו רישיון בדיוק. המאגר מיועד למחקר ולתחרות בלבד.

כמה שטח דיסק צריך בשביל המאגר הזה?

המאגר השלם כולל מעל 54,000 קבצים ונפחו המלא לא מפורט במדויק בכרטיס. עם זאת, קיימת תיקיית אימון של עשרה אחוזים שמוגדרת סביב 16 גיגה בייט. מומלץ להתחיל ממנה לפני שמורידים את כל הנתונים.

האם יש תמיכה בעברית בהנחיות הטקסט?

לא, קובץ ההנחיות CVPR25_TextSegFMData_with_class.json והמפתחות מכילים תיאורים באנגלית בלבד. המאגר נאסף מתחרויות ומחקרים בינלאומיים ללא התאמה לשפות אחרות.

מאיפה הגיעו הסריקות ואיך הן עובדו?

הסריקות נאספו ממאגרים רפואיים ציבוריים שאישרו הפצה מחדש, כמו AMOS ו־BraTS. המארגנים חילצו מתוכן רק את הפרוסות המתויגות, נירמלו את העוצמות לטווח של 0 עד 255 וארזו אותן כקובצי npz.

איך טוענים

טוענים את הנתונים ישירות בפייתון באמצעות numpy.load עם תמיכה בפיקל. אין צורך באישור גישה ידני או הרשמות מיוחדות, אך המאגר כולל מעל 54,000 קבצים ולכן הורדת כל האימון דורשת רוחב פס ושטח דיסק משמעותי. בקובצי האימון השדות המרכזיים הם imgs, gts ו־spacing. קובצי הולידציה והבדיקה לא כוללים את gts, ומכילים במקומם תיבות תוחמות או מפתח של text_prompts.

from datasets import load_dataset

ds = load_dataset("junma/CVPR-BiomedSegFM")

הרישיון

הרישיון הוא cc-by-nc-sa-4.0. המשמעות היא איסור מוחלט על שימוש מסחרי, חובת מתן קרדיט ליוצרים, ודרישה שכל מודל, משקולות או נגזרת שיאומנו עליו יופצו תחת אותו רישיון בדיוק. אם היעד שלכם הוא מוצר מסחרי, אי אפשר להשתמש במאגר הזה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗