GPT
P

path-vqa

קוד פתוח

flaviagiammarinomit2023-06-02

  • medical

מאגר שאלות ותשובות ממוקד לתמונות פתולוגיה רפואיות. מתאים למי שרוצה לאמן או לבחון מודלי ראייה ושפה על אבחון רקמות בלי לגרד מידע לבד.

  • 5,908הורדות בחודש
  • 74לייקים

מה זה

המאגר מכיל 32,632 שלשות של תמונה, שאלה ותשובה, שנבנו מתוך 4,289 תמונות פתולוגיות. המידע נלקח משני ספרי לימוד מובילים בתחום הפתולוגיה, Textbook of Pathology ו Basic Pathology, לצד הספרייה הדיגיטלית PEIR. השאלות כוללות שאלות פתוחות לצד שאלות בינאריות של כן ולא, כולן באנגלית בלבד.

הקריאה והסינון הורידו כפילויות של שלשות שהופיעו באותה חלוקה, והשאירו רק תמונות שקשורות בפועל לשאלות. 715 תמונות מתוך המקור המקורי נותרו ללא שאלות ולא נכללו בעיבוד הסופי.

החלוקה הפנימית מוגדרת מראש על ידי המחברים לשלושה חלקים. סט האימון מכיל 19,654 שאלות על 2,599 תמונות, הוולידציה כוללת 6,259 שאלות על 832 תמונות, וסט הבדיקה מכיל 6,719 שאלות על 858 תמונות.

מתאים ל

  • אימון מודלי VQA רפואיים

    לימוד מודלים רב אופניים לענות על שאלות פתוחות ושאלות כן ולא סביב ממצאים ברקמות.

  • הערכת ביצועי מודלי שפה וראייה

    בדיקת דיוק התשובות על סט הבחינה המובנה מול לוח התוצאות הקיים בתחום.

  • מחקר על הבנת תמונות מיקרוסקופיות

    בחינת יכולות הסקת מסקנות ויזואליות מתוך צילומי פתולוגיה ברמת פיקסל והקשר קליני.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים על מקורות אקדמיים וספרים ולא על מקרים קליניים ישירים ומגוונים. התמונות מגיעות משני ספרים וספרייה אחת בלבד, כך שיש סיכון ממשי להטיה סגנונית של הדמיות והסברים. לא הייתי מכניס מודל שאומן על זה למוצר רפואי אמיתי בלי בדיקה מעמיקה של התאמה לקליניקה מקומית. בנוסף, זכויות היוצרים על התמונות והכיתובים המקוריים שייכים למוציאים לאור של הספרים ולספריית PEIR, עובדה שדורשת זהירות משפטית.

שאלות
נפוצות

האם המאגר מתאים לפיתוח מסחרי?

הקוד והדאטהסט סומנו תחת רישיון MIT, שמאפשר שימוש מסחרי, אך זכויות התמונות המקוריות נותרו אצל מחברי ספרי הלימוד והספרייה הדיגיטלית. לא הייתי מכניס אותו למוצר קצה מסחרי בלי ייעוץ משפטי לגבי זכויות התמונות.

האם יש בדאטהסט תמיכה בעברית?

לא, כל השאלות והתשובות מופיעות באנגלית בלבד. אם צריך לעבוד בעברית, נדרש תרגום מקדים של הטקסטים והתאמה של המונחים הרפואיים המקצועיים.

מאיפה התמונות והשאלות הגיעו?

החומר לוקט משני ספרי לימוד פתולוגיים מוכרים, Textbook of Pathology ו Basic Pathology, ובנוסף מספריית הרשת PEIR. המידע הומר לשלשות של תמונה, שאלה ותשובה ונוקה מכפילויות על ידי יוצרי המאגר.

איך מודדים הצלחה על המאגר?

ההערכה המקובלת מתחלקת לשלושה מדדים: דיוק בשאלות כן ולא, דיוק בתשובות חופשיות ודיוק כולל. התוצאות מדווחות על סט הבדיקה הרשמי שמופרד מראש מסט האימון.

איך טוענים

הנתונים ארוזים ב 16 קבצים, בעיקר בפורמט Parquet בחלוקה לחלקים ממוספרים, וזמינים להורדה ישירה ללא צורך בהרשמה מוקדמת או אישור גישה מיוחד. המבנה של כל רשומה פשוט מאוד וכולל שלושה שדות: image שמחזיק את התמונה עצמה, question לשאלה בטקסט, ו answer לתשובה הצפויה. בגלל שמדובר בפורמט Parquet מודרני, הטעינה בספריות הנתונים הסטנדרטיות מהירה ולא דורשת המרות מוקדמות.

from datasets import load_dataset

ds = load_dataset("flaviagiammarino/path-vqa")

הרישיון

המאגר שוחרר ברישיון MIT, מה שמתיר שימוש מסחרי, שינוי והפצה ללא דרישה לשיתוף תחת אותו רישיון, בכפוף למתן ייחוס. עם זאת, בכרטיס מצוין בבירור שזכויות היוצרים על התמונות והטקסטים המקוריים שייכות למוציאים לאור של הספרים ולספריית PEIR. מומלץ לבדוק את ההשלכות המשפטיות לגבי מודלים מסחריים לפני שמתחילים לאמן.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗