GPT
P

PubMedVision

קוד פתוח

FreedomIntelligenceapache-2.02024-06-25

  • GPT-4V
  • Vision
  • medical
  • biology

מדובר במאגר של 1.3 מיליון זוגות שאלות ותשובות על תמונות רפואיות שנלקחו ממאמרים ב־PubMed. הוא מיועד למי שרוצה לאמן מודלים מולטימודליים להבין צילומי רפואה באנגלית או בסינית.

  • 485הורדות בחודש
  • 107לייקים

מה זה

החוקרים שלפו צמדי תמונות וטקסט מתוך מאמרים מדעיים פתוחים ב־PubMed, ואז העבירו אותם עיבוד מחדש באמצעות GPT-4V כדי לייצר שאלות ותשובות ברורות. בנוסף, הם השתמשו במודל HuatuoGPT-Vision-7B כדי לתייג את איבר הגוף ואת שיטת הדימות בכל תמונה.

המאגר מחולק לשני חלקים שווים בגודלם, כ־647 אלף רשומות בכל אחד. חלק אחד מוגדר כ־Alignment VQA ונועד ליישור ראשוני בין התמונה לטקסט, והחלק השני הוא Instruction Tuning VQA לכיוונון עדין של הוראות. בפברואר 2025 נוספו למאגר גם הכיתובים המקוריים של התמונות וכן גרסה מתורגמת לסינית.

מתאים ל

  • אימון הוראות מולטימודלי

    כיוונון של מודל ראייה ושפה על החלק של Instruction Tuning כדי שיענה לשאלות על ממצאים קליניים.

  • יישור תמונה וטקסט רפואי

    חיבור וקטורי בין סריקות דימות להסברים מילוליים באמצעות קובץ ה־Alignment.

  • סיווג תמונות לפי איבר ושיטה

    אימון מסווגים מהירים לזיהוי שיטת הדימות ואיבר הגוף לפי התיוגים שנוספו למאגר.

איפה זה נופל

אין כאן שום מידע בעברית, הכל באנגלית ובסינית בלבד. בנוסף, השאלות והתשובות עברו שכתוב על ידי GPT-4V, והתיוגים של איברי הגוף נעשו במודל אוטומטי, כך שאין כאן בדיקה ידנית של רופא על כל אחת ממיליון הרשומות. לא הייתי מכניס מודל שאומן על זה ישירות לטיפול בחולים בלי בדיקה קלינית מחמירה.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן, הרישיון הוא apache-2.0 ומאפשר שימוש מסחרי מלא. אתם רק נדרשים לשמור על תנאי הקרדיט והודעת הרישיון המקורית.

האם יש תמיכה בעברית?

לא, הנתונים קיימים באנגלית ובסינית בלבד. כדי להשתמש בזה למערכת ישראלית תצטרכו לתרגם את השאלות והתשובות או להסתמך על יכולת התרגום של המודל שלכם.

איך המידע הזה נאסף בפועל?

היוצרים חילצו צמדי תמונות והסברים מתוך מאגר המאמרים הפתוח PubMed. לאחר מכן הם נעזרו ב־GPT-4V כדי לייצר שאלות ותשובות איכותיות על בסיס הטקסט המקורי, והוסיפו תיוג אוטומטי של איבר גוף ושיטת דימות בעזרת מודל ייעודי.

מה צריך לקחת בחשבון מבחינת נפח האחסון?

המאגר כולל עשרים קובצי zip לפחות של תמונות שצריך לפתוח לתיקייה אחת, לצד קובצי JSON גדולים שמחזיקים מיליון ורבע שאלות ותשובות. זה דורש נפח דיסק משמעותי ותהליך חילוץ שלוקח זמן.

איך טוענים

אין צורך באישור גישה מיוחד כדי להוריד את הקבצים. התמונות מגיעות דחוסות בלפחות עשרים קובצי zip שונים, מה שאומר שתצטרכו להוריד אותם ידנית או בסקריפט ולפתוח הכל לתיקייה אחת מקומית. קובצי המידע עצמם שמורים בפורמט JSON, והם כוללים את השאלות, התשובות, הנתיבים לתמונות, ותיוגים כמו איבר גוף ושיטת הדימות.

from datasets import load_dataset

ds = load_dataset("FreedomIntelligence/PubMedVision")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי והפצה, ואינו מחייב אתכם לשחרר מודלים שאימנתם תחת אותו רישיון. החובה היחידה היא לתת קרדיט למחברים המקוריים ולצרף עותק של כתב הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗