GPT
P

pmc_oa

קוד פתוח

axiongרישיון לא דווח2023-04-02

תמונות מדעיות עם כיתובים ממאמרים רפואיים פתוחים. מתאים למי שבונה מודלים שצריכים להבין הקשר ויזואלי של צילומי רנטגן, MRI ודימות ביולוגי.

  • 1,482הורדות בחודש
  • 64לייקים

מה זה

המאגר מבוסס על תמונות שנלקחו מפרסומים רפואיים פתוחים ב־PubMed Central, לצד הכיתובים המקוריים שליוו אותם. המבנה עצמו כולל קובצי ארכיון של תמונות ומטא-דאטה שיושב בקובצי jsonl. כל רשומה כוללת שני שדות פשוטים בלבד, נתיב אל קובץ התמונה והטקסט של הכיתוב שמתאר אותה.

יש שתי גרסאות שונות של הנתונים במאגר. הגרסה שנקראת pmc_oa משתמשת בעיבוד שנעשה בעזרת ChatGPT כדי לפרק כיתובים מורכבים שמכילים מספר תת-תמונות לכיתובים נפרדים ונקודתיים. הגרסה השנייה, שמסומנת כגרסת בטא, שומרת על הכיתובים המורכבים כפי שהופיעו במקור בלי פירוק. חלוקות ישנות שהופיעו בעבר לקובצי אימון, בדיקה ואימות סומנו כמבוטלות, כך שהעבודה מתבצעת ישירות מול הקבצים המלאים.

המפרסם שמר לצד הדאטהסט גם משקולות של מודלים כמו ViT ו־ResNet50, יחד עם דוגמאות בודדות של סריקות מוח ורנטגן חזה, כדי להראות התאמה למשימות של קישור טקסט לתמונה רפואית.

מתאים ל

  • אימון מודלי ראייה רפואיים

    חיבור בין תמונות ביולוגיות ורפואיות לטקסט לצורך משימות של שליפת מידע והתאמת תמונה לכיתוב.

  • הערכת תיאורי דימות

    בדיקת יכולת של מודלים קיימים להבין מושגים מורכבים מתוך כיתובים מפורטים של צילומי מעבדה וסריקות.

  • כיוונון מקודדי תמונה

    התאמת ארכיטקטורות דוגמת ResNet או ViT לעבודה ישירה על דימות מדעי המגיע ממאמרים פתוחים.

איפה זה נופל

הכרטיס לא מספק פרטים על כמות הרשומות המדויקת, הסינון שעברו המאמרים או תאריכי הפרסום שלהם. יש תלות כבדה בפירוק כיתובים שנעשה על ידי ChatGPT בגרסה הראשית, מה שיכול להכניס טעויות או הזיות של מודל שפה לתוך התיאור. המאגר מבוסס על אנגלית בלבד, ואין פילוח של סוגי דימות או מחלות. אי אפשר לדעת איזה ייצוג יש למצבים נדירים בלי לבצע ניתוח עצמאי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ בכלל. בעמוד המאגר לא צוין רישיון, ומבחינה חוקית אין לכם הרשאה מפורשת להשתמש בתוכן. במקרה של שימוש מסחרי, זה חושף אתכם לתביעות של בעלי הזכויות.

האם יש במאגר נתונים בעברית?

לא. החומר נאסף ממאמרים אקדמיים פתוחים שפורסמו באנגלית. כל הכיתובים והמונחים הרפואיים מופיעים באנגלית בלבד.

מה ההבדל בין קובץ pmc_oa לקובץ הבטא?

בקובץ הבטא הכיתובים נשארו כמו במקור, כולל תיאורים מורכבים של כמה תמונות יחד. בקובץ הראשי השתמשו ב־ChatGPT כדי לפצל את התיאור כך שכל משפט יתאים לתמונה הספציפית שלו.

למה התצוגה המקדימה באתר לא מציגה את כל המידע?

המפתח ציין שהממשק של האתר מתקשה להתמודד עם קנה המידה של הנתונים. לצורך צפייה בדוגמאות ברשת נפתח מאגר הדגמה נפרד, ועבור הנתונים המלאים צריך להוריד את הקבצים ישירות.

איך טוענים

העבודה מול המאגר לא נעשית דרך ה־viewer הרגיל באתר בגלל בעיות ביצועים בגדלים האלה. מורידים ידנית את images.zip ואת קובץ pmc_oa.jsonl או גרסת הבטא. כל שורה בקובץ הנתונים מכילה מילון עם מפתח התמונה והכיתוב שלה. אין צורך באישור גישה מיוחד, אבל צריך לפרוק את ארכיון התמונות ולחבר את הנתיבים היחסיים לקוד שלכם.

from datasets import load_dataset

ds = load_dataset("axiong/pmc_oa")

הרישיון

היוצר לא הגדיר רישיון שימוש במאגר. במצב כזה, מבחינה משפטית אין היתר ברור להשתמש במידע, לא למחקר ולא לפיתוח מסחרי. מי שמאמן מודל על הנתונים האלה מסתכן בהפרת זכויות יוצרים, במיוחד אם מדובר במוצר שמיועד להפצה או למכירה לחברות וארגונים.

הרישיון המלא ב־Hugging Face ↗