GPT
R

rad-dino

קוד פתוח

microsoftרישיון לא דווח2024-05-17

  • transformers
  • safetensors
  • dinov2
  • image-feature-extraction
  • endpoints_compatible

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל ראייה מבוסס שנאים שחולץ וקטורים מצילומי חזה ברנטגן. הוא מציע בסיס חזק למשימות סיווג ומקטוע רפואי בלי צורך באימון מחדש של כל הרשת.

  • 87Mפרמטרים
  • 839 MBמשקל הקבצים
  • 140,610הורדות בחודש
  • 85לייקים

מה זה

מיקרוסופט אימנו את המודל על בסיס dinov2-base בלמידה ללא פיקוח, תוך שימוש ב־882,775 צילומי רנטגן מחמישה מאגרי מידע ציבוריים. התוצר אינו מחזיר תשובה טקסטואלית אלא וקטורים שמייצגים את התמונה כולה לצד וקטורים מקומיים של מקטעים בתוכה. זה מאפשר לחבר מעליו ראשים שונים, מסיווג מחלות ועד איתור אזורים חשודים, כשהמודל המרכזי נשאר קפוא.

הגישה הזו נשענת על כך שמשקלי הראייה הכלליים של מטא כוונו ספציפית לצילומי חזה. במקום להסתמך על תיאורים טקסטואליים של רדיולוגים שעלולים להטעות, המודל למד ישירות מהמבנה הוויזואלי של הצילומים, מה שהופך את הייצוגים שלו לעשירים ומדויקים יותר לעבודה קלינית מחקרית.

מתאים ל

  • סיווג ממצאים בצילום חזה

    אימון שכבת סיווג פשוטה על גבי וקטור ה־CLS כדי לזהות פתולוגיות נפוצות בצילום.

  • מקטוע אזורים חשודים

    שימוש במערך וקטורי המקטעים כקלט לפענוח מיקום מדויק של ממצאים בריאות.

  • חיפוש מקרים דומים

    השוואת וקטור התמונה לוקטורים במאגר לצורך מציאת צילומים דומים בשיטת השכן הקרוב.

איפה זה נופל

המודל אינו מיועד לשימוש רפואי או קליני בשטח, אלא למחקר בלבד. הנתונים שעליהם הוא אומן הגיעו משלוש מדינות בלבד, מה שמייצר הטיה ברורה לאוכלוסיות ספציפיות שלא בהכרח מייצגות חולים בישראל או במקומות אחרים. בנוסף, נקודת הביקורת שפורסמה כאן אינה זהה לחלוטין לזו שמופיעה במאמר המדעי המקורי, שכן במאמר נעשה שימוש גם במידע פרטי.

שאלות
נפוצות

האם המודל מייצר דוח פענוח מלא לצילום?

לא, המודל מחלץ רק מאפיינים ויזואליים בצורת וקטורים מספריים. כדי להפיק דוח טקסטואלי צריך לחבר אותו למודל שפה נפרד שיידע לקרוא את הייצוגים האלה ולתרגם אותם למילים.

האם צריך לאמן מחדש את כל המודל על הנתונים שלי?

לפי המפתחים אין צורך בכך כדי להגיע לתוצאות טובות. מספיק להקפיא את המודל ולאמן שכבה קטנה מעליו עבור המשימה הספציפית שלכם.

איך מריצים

עם 87 מיליון פרמטרים ומשקל קבצים של פחות מגיגהבייט, אפשר להריץ אותו מקומית על כמעט כל מחשב עם מעבד גרפי בסיסי, ואפילו על מעבד רגיל אם זמן התגובה פחות קריטי. ההתקנה פשוטה דרך פקודת pip רגילה לספריית rad-dino, והוא מוציא ישירות וקטור של 768 ממדים לתמונה לצד מטריצה של 37 על 37 מקטעים.

אין שום סיבה לחפש ספק ענן או לשלם על קריאות שרת עבור מודל במשקל כזה. אם אתם מעבדים קובצי DICOM, הכרטיס מדגיש שצריך לשנות את גודל הצד הקצר ל־518 פיקסלים ולנרמל את ערכי הפיקסלים לטווח שבין 0 ל־255 כדי לקבל תוצאות שתואמות לאימון.

from transformers import pipeline

pipe = pipeline("image-feature-extraction", model="microsoft/rad-dino")
print(pipe("שלום"))

הרישיון

בכרטיס המודל המפתחים ציינו רישיון MIT, למרות שבנתוני המטאדטה של הדף הרישיון מוגדר כלא דווח. אם מסתמכים על טקסט הכרטיס, רישיון MIT מתיר שימוש מסחרי חופשי, אך החוקרים כותבים במפורש שהמודל מיועד למטרות מחקר בלבד ולא לשימוש קליני.

הרישיון המלא בעמוד המודל ↗