GPT
P

PMC-VQA

קוד פתוח

RadGenomeרישיון לא דווח2023-05-24

שאלות ותשובות מרובות ברירה על דימות רפואי מתוך מאמרים אקדמיים. מי שבונה מודל רב-מודאלי לתחום הרפואי יקבל כאן נתונים שמחברים ישירות בין צילומי דימות להסברים קליניים.

  • 3,075הורדות בחודש
  • 78לייקים

מה זה

המאגר מכיל זוגות של שאלות ותשובות המבוססות על תמונות רפואיות שנאספו מתוך מאמרי גישה פתוחה ב־PubMed Central. בגרסה הראשונה יש 227 אלף זוגות שאלות ותשובות שמתבססים על 149 אלף תמונות, והגרסה השנייה מתמקדת בתמונות שאינן מורכבות ממספר פאנלים יחד.

כל רשומה בטבלאות הנתונים כוללת נתיב לתמונה, שאלה רפואית באנגלית, ארבע אפשרויות בחירה (Choice A עד Choice D), התשובה הנכונה המלאה והאות שמייצגת אותה. הנתונים מחולקים מראש לקובצי אימון ומבחן, וכוללים קובץ מבחן נקי ורשימת קבצים מלאה של מקורות המאמרים הפתוחים.

מתאים ל

  • אימון מודלי VQA רפואיים

    לימוד מודלים רב-מודאליים לענות על שאלות אמריקאיות המבוססות על תמונות דימות.

  • הערכת ביצועי מודל קיים

    בדיקת יכולת ההבנה הקלינית של מודל ראייה-שפה באמצעות קובצי הבדיקה המוכנים.

  • חילוץ תובנות מדימות

    זיהוי דפוסים וממצאים ספציפיים מתוך צילומים רפואיים מגוונים.

איפה זה נופל

כל התוכן מבוסס על ספרות רפואית באנגלית בלבד, כך שאין כאן שום ייצוג לעברית או למינוח מקומי. בנוסף, מדובר בתמונות שפורסמו במאמרים מדעיים ולא בסריקות גולמיות מתוך מערכות פקס בבתי חולים, ולכן הן כוללות עיבודים גרפיים, חיתוכים ואיכויות דחיסה שונות. הכרטיס לא מפרט כיצד סוננו או נוצרו השאלות, מה שדורש בדיקה ידנית של איכות התוכן לפני שמבססים עליו מודל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאמרים המקוריים מאושרים לשימוש מסחרי, אך הדאטהסט מופץ תחת רישיון CC BY-SA. רישיון זה דורש שיתוף באותם תנאים, מה שמציב סיכון משפטי עבור מודלים קנייניים סגורים. מומלץ לבדוק את ההשלכות של שיתוף זהה לפני שילוב בקוד סגור.

האם יש במאגר נתונים בעברית?

לא. כל השאלות, התשובות והתמונות נלקחו מתוך מאמרים אקדמיים שנכתבו באנגלית בלבד. כדי להשתמש בו בהקשר ישראלי תצטרכו לתרגם את השאלות ולהתאים את המינוח המקצועי.

מה ההבדל בין גרסה 1 לגרסה 2 של המאגר?

הגרסה הראשונה כוללת 227 אלף זוגות שאלות ותשובות ו־149 אלף תמונות, שחלקן מורכבות ממספר תרשימים ופאנלים שונים באותו קובץ. הגרסה השנייה מספקת קובצי נתונים ותמונות נפרדים שמתמקדים בתמונות בודדות ולא מורכבות.

איך נאספו התמונות והשאלות?

החומרים נאספו מתוך מאגר המאמרים החופשיים של PubMed Central מתוך החלק המוגדר לשימוש מסחרי. המפרסמים סיפקו קובץ שמקשר כל פריט למזהה המאמר המקורי שלו.

איך טוענים

אין צורך לבקש אישור גישה מיוחד כדי להוריד את הקבצים. אתם מורידים את קובצי ה־CSV המכילים את המטא-דאטה ואת ארכיוני התמונות הדחוסים, images.zip או images2.zip. העבודה מול הנתונים דורשת חילוץ מקומי של התמונות וקישור שלהן לטבלאות באמצעות עמודת Figure_path. שימו לב שבשמות הקבצים והשדות יש חוסר אחידות קל בין הגרסאות, כולל שגיאת כתיב במקור בשם השדה של תווית התשובה.

from datasets import load_dataset

ds = load_dataset("RadGenome/PMC-VQA")

הרישיון

המאמרים המקוריים נלקחו מחלוקת השימוש המסחרי של PubMed Central תחת רישיונות CC0 ו־CC BY. הדאטהסט עצמו משוחרר תחת רישיון CC BY-SA, שמחייב מתן קרדיט ושיתוף של נגזרות תחת אותו רישיון בדיוק. אם אתם מאמנים מודל על הנתונים האלה, חובת השיתוף עשויה להגביל שילוב שלו במוצרים מסחריים סגורים.

הרישיון המלא ב־Hugging Face ↗