GPT
V

vqa-rad

קוד פתוח

flaviagiammarinocc0-1.02023-06-03

  • medical

שאלות ותשובות קליניות שנכתבו בידי רופאים על גבי צילומי רדיולוגיה. מאגר קטן וממוקד שמתאים במיוחד להערכת מודלים של עיבוד תמונה וטקסט רפואי.

  • 6,921הורדות בחודש
  • 100לייקים

מה זה

המאגר מציע שלשות של תמונה, שאלה ותשובה סביב דימות רפואי. התמונות נלקחו מתוך מאגר MedPix החופשי, וצוות קלינאים ניסח את השאלות והתשובות באופן ידני. השאלות מתחלקות לשני סוגים מרכזיים, שאלות כן ולא סגורות מול שאלות פתוחות שדורשות זיהוי ומענה מורכב יותר.

במקור נאספו 2,248 זוגות שאלות ותשובות על גבי 315 תמונות מתוך Open Science Framework. המפרסמת ניקתה את הנתונים, הסירה תמונה אחת ללא שאלות, מחקה שלוש כפילויות מאימון ועוד דוגמה אחת שהופיעה גם באימון וגם במבחן. לאחר הניקוי נותרו 2,244 זוגות שאלות ותשובות שמבוססים על 314 תמונות.

החלוקה הפנימית נשענת על הפיצול שהגדירו יוצרי המחקר המקורי. קובץ האימון מכיל 1,793 שאלות ותשובות על פני 313 תמונות. קובץ המבחן כולל 451 שאלות ותשובות על גבי 203 תמונות, כך שחלק מהתמונות משותפות בין החלוקות אך השאלות עצמן נפרדות.

מתאים ל

  • הערכת מודלי VQA רפואיים

    מדידת דיוק התשובות הפתוחות והסגורות של מודל מול תשובות שנכתבו בידי צוות רופאים.

  • בדיקת הבנת תמונות רנטגן

    בחינת היכולת של מודל מולטימודלי לענות על שאלות כן ולא פשוטות לגבי ממצאים ברדיולוגיה.

  • ולידציה מהירה לניסויי מחקר

    בדיקת ביצועים זריזה על מערך מבחן מוגדר וקטן בלי צורך בתשתיות אחסון או חישוב כבדות.

איפה זה נופל

הבעיה הגדולה ביותר כאן היא הגודל. עם 314 תמונות בלבד, אי אפשר לאמן פה מודל ראייה רפואי מאפס, ואפילו לכוונון עדין יש סכנת התאמת יתר כבדה. המאגר כולו באנגלית ואין בו מילה בעברית. שאלות על צילומי רנטגן או סיטי דורשות הבנה של מונחים מקצועיים של רופאים, ולא הייתי מעלה מוצר קליני שמסתמך על ביצועים במאגר קטן כל כך בלי לבדוק אותו על מאות מקרים מקומיים נוספים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא נחלת הכלל מלאה. אין הגבלה על שימוש מסחרי, ואין חובה לציין את המקור במוצר הסופי. יחד עם זאת, בגלל שמדובר במידע רפואי, האחריות על ביצועי המודל בשטח היא שלכם.

האם הנתונים כוללים עברית?

לא, כל השאלות והתשובות מנוסחות באנגלית רפואית בלבד. אם המערכת שלכם מיועדת לעבודה מול רופאים בישראל בשפה העברית, תצטרכו לתרגם את המונחים או לאסוף דוגמאות ייעודיות.

מאיפה נאספו התמונות והשאלות?

התמונות הגיעו ממאגר MedPix הפתוח של הספרייה הלאומית לרפואה בארצות הברית. השאלות והתשובות נכתבו ידנית בידי צוות קלינאים ולא הופקו בצורה אוטומטית, מה שמבטיח איכות ניסוח מקצועית.

כמה שטח אחסון צריך כדי לעבוד עם המאגר?

מעט מאוד, מדובר במאגר של מאות תמונות בודדות ושני קובצי Parquet קטנים. אפשר להוריד ולהריץ אותו ישירות גם על מחשב נייד בסיסי בלי שום חומרה מיוחדת או כוננים חיצוניים.

איך טוענים

טוענים את המאגר ישירות מחיבור Hugging Face סטנדרטי בלי צורך באישור גישה או הרשמה מיוחדת. הנתונים שמורים בשני קובצי Parquet, אחד לאימון ואחד למבחן, לצד סקריפט עיבוד בפייתון. המאגר שוקל מעט מאוד וכולל בסך הכל חמישה קבצים, כך שההורדה מסתיימת תוך שניות בודדות גם בחיבור אינטרנט ביתי רגיל.

המבנה של כל רשומה פשוט וכולל שלושה שדות בלבד. שדה התמונה מכיל את אובייקט הדימות עצמו בפורמט ויזואלי, שדה השאלה מביא את הטקסט שנשאל על התמונה, ושדה התשובה מחזיק את מחרוזת המענה הקליני הצפוי. אפשר להתחיל להריץ עליו בדיקות מיד בלי לפרק קבצי ארכיון ידנית.

from datasets import load_dataset

ds = load_dataset("flaviagiammarino/vqa-rad")

הרישיון

המאגר שוחרר תחת רישיון CC0 1.0 Universal, כלומר נחלת הכלל. מותר להשתמש בו לכל מטרה, כולל שימוש מסחרי מלא, שינוי והפצה, בלי חובת ייחוס ובלי דרישה לשתף תוצרים באותו רישיון. מודלים שתאמנו עליו חופשיים ממגבלות זכויות יוצרים של הדאטהסט.

הרישיון המלא ב־Hugging Face ↗