GPT
K

Kvasir-VQA-x1

קוד פתוח

SimulaMetcc-by-nc-4.02025-06-11

  • medical
  • kvasir

מאגר שאלות ותשובות ויזואליות לתחום האנדוסקופיה של דרכי העיכול. הוא מיועד למי שמפתח או בוחן מודלים רב-מודאליים על משימות הסקת מסקנות קלינית מורכבת מול תמונות רפואיות.

  • 7,809הורדות בחודש
  • 16לייקים

מה זה

המאגר כולל 159,549 זוגות של שאלות ותשובות שמבוססים על תמונות מתוך פרויקט Kvasir-VQA המקורי. השאלות נבנו על ידי מיזוג שאלות אטומיות לשאלות מורכבות יותר בשפה טבעית, והתשובות עברו תיקוף קליני. כל רשומה כוללת מזהה תמונה, רמת מורכבות שמדורגת בין 1 ל־3, את השאלה המורכבת, התשובה המאומתת, רשימת השאלות הבסיסיות שמוזגו לתוכה וסיווג לקטגוריה קלינית מתאימה.

הנתונים מחולקים מראש לשני חלקים בלבד, אימון ומבחן. החלוקה בוצעה ברמת התמונות כדי למנוע זליגת מידע, כך ששום תמונה או צמד שאלה ותשובה מסט המבחן לא מופיעים בסט האימון. בנוסף לטקסט, המאגר תומך בבדיקות חוסן ויזואלי מול שיבושים בתמונות באמצעות כלי אוגמנטציה ייעודיים שהחוקרים פרסמו לצדו.

מתאים ל

  • אימון מודלי VLM רפואיים

    כוונון עדין של מודלי ראייה ושפה להבנת ממצאים באנדוסקופיה.

  • בדיקת חוסן ויזואלי

    הערכת עמידות של מודלים מול שיבושים והפרעות בתמונות רפואיות.

  • מדידת הסקה קלינית

    בחינת יכולת המודל לענות על שאלות מורכבות ברמות קושי שונות.

איפה זה נופל

כל הטקסט במאגר מופיע באנגלית בלבד, כך שאין כאן תמיכה בעברית או במונחים רפואיים מקומיים. המאגר מוגבל אך ורק לצילומי אנדוסקופיה של מערכת העיכול ולא מייצג בדיקות דימות אחרות. בנוסף, מי שבונה מוצר צריך לקחת בחשבון שהמורכבות מסתמכת על מיזוג שאלות בסיסיות, ויש לבחון היטב את איכות התשובות והתאמתן לשימוש מעשי מחוץ לתנאי מחקר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-4.0, והוא אוסר שימוש מסחרי באופן מפורש. המאגר מיועד למחקר אקדמי ולניסויים בלבד.

האם יש במאגר שאלות ותשובות בעברית?

לא. כל השאלות, התשובות והקטגוריות הקליניות כתובות באנגלית בלבד. אם המטרה היא לעבוד מול רופאים בישראל בשפת המקור, תצטרכו לתרגם ולתקף את הנתונים בעצמכם.

מאיפה הגיעו התמונות והשאלות?

התמונות מבוססות על מאגר Kvasir-VQA המוכר בתחום הגסטרואנטרולוגיה. החוקרים יצרו 159,549 שאלות מורכבות על ידי איחוד שאלות קיימות, ותיקפו את התשובות מבחינה קלינית.

איך בנויה החלוקה בין אימון לבדיקה?

המאגר מפוצל לשני קובצי parquet, אחד לאימון ואחד למבחן. החלוקה נעשתה ברמת התמונה כדי להבטיח שאף תמונה או שאלה מסט הבדיקה לא תזלוג לאימון.

איך טוענים

הנתונים הטבלאיים שמורים בקובצי parquet עבור האימון והבחינה, לצד תיקיית תמונות בפורמט jpg. הגישה למאגר פתוחה לגמרי ללא צורך בהרשמה מוקדמת או אישור מיוחד. כדי להריץ אימון של מודלי ראייה ושפה, יש צורך לקשר בין קובץ הנתונים לתמונות לפי שדה img_id, או להשתמש בסקריפטים שהחוקרים שיתפו בגיטהאב ליצירת קובצי JSONL מתאימים.

from datasets import load_dataset

ds = load_dataset("SimulaMet/Kvasir-VQA-x1")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0. המשמעות ברורה וחד משמעית, השימוש מותר למטרות מחקר ואקדמיה בלבד, וחל איסור מוחלט על שימוש מסחרי מכל סוג. חובה לתת ייחוס הולם ליוצרים, ואסור לשלב אותו במודלים או שירותים שמיועדים להפצה עסקית.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗