GPT
M

MedText

קוד פתוח

BI55cc-by-4.02023-07-25

המאגר מכיל מעל אלף מקרים רפואיים שנועדו ללמד מודלים לאבחן, לזהות כשחסר מידע ולהפנות לרופא. הוא פונה למי שמחפש דוגמאות שכוללות גם רעש ומגבלות מובנות.

  • 437הורדות בחודש
  • 92לייקים

מה זה

המאגר כולל קצת יותר מאלף רשומות שמציגות תיאורי מקרה של מטופלים יחד עם אבחנה ותוכנית טיפול. הנתונים מתמקדים במאה המחלות הנפוצות ביותר ובשלושים פציעות שכיחות שמגיעות לבתי חולים, החל ממצבים קלים ועד למקרים מורכבים וקשים. יש כאן גם ניתוח טקסטואלי של בדיקות דם והדמיות כמו אולטרסאונד, סי טי, אם אר איי וצילומי רנטגן.

היוצרים לקחו נתונים מקוריים והמירו אותם למבנה אחיד באמצעות GPT-4. החומר עבר ערבוב אקראי כדי למנוע שכחה קטסטרופלית של המודל לפי קטגוריות. בנוסף לפתולוגיות, הוכנסו בכוונה מקרים עם מידע סותר, תסמינים מטעים, תלונות שאינן רפואיות, ושאלות ישירות על מהות הבינה המלאכותית שדורשות ממנה להבהיר שאינה מחליפה רופא.

מתאים ל

  • אימון סייג רפואי

    לימוד מודלים לזהות מתי המידע אינו מספיק לאבחנה ולהפנות את המשתמש לבדיקת רופא.

  • הערכת עמידות לרעש

    בדיקת יכולת המודל להתמודד עם תסמינים מטעים וסתירות פנימיות בטקסט של מטופל.

  • התאמת מודל לטריאז'

    כיוונון עדין של מודל שפה למיון ראשוני של פציעות ומחלות נפוצות לפי רמת חומרה.

איפה זה נופל

בדיקת האיכות של המאגר נשענת על מדגם זעיר של עשרה מקרים בלבד שנבדקו מול שלושה רופאים, שניים מהם היו מעורבים ביצירת הפרויקט. הנתונים כולם באנגלית, עברו עיבוד דרך GPT-4, ואין פירוט לגבי מקור המידע הגולמי שממנו נוצרו המקרים. כמות הדוגמאות קטנה מאוד לאימון מודל מאפס, והיא משקפת בעיקר מצבים כלליים של רפואה דחופה בלי התאמה מקומית לישראל או לפרוטוקולים של קופות החולים בארץ.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן, הרישיון הוא CC BY 4.0 שמתיר שימוש מסחרי חופשי לחלוטין. הדרישה היחידה היא לציין את BI55 כמקור הנתונים. אין מניעה למכור מוצר או שירות שמסתמך על מודל שאומן עליו.

האם יש במאגר תוכן בעברית?

לא, כל המקרים הרפואיים והאבחנות מנוסחים באנגלית בלבד. אם המטרה היא לעבוד מול מטופלים ישראלים, תצטרכו לתרגם את הנתונים או לאמן על חומר מקומי. שימוש ישיר בעברית ידרוש התאמה של המונחים והפרוטוקולים.

מאיפה הגיעו המקרים הרפואיים ואיך הם נבנו?

היוצרים מגדירים את החומר כמידע מקורי שעבר סטנדרטיזציה באמצעות GPT-4. הם כללו בכוונה מקרים קלים, בינוניים וקשים לצד בדיקות מעבדה והדמיות. עשרה מקרים נבדקו ואושרו על ידי שלושה רופאים כחומר באיכות של ספר לימוד.

במה הוא שונה ממאגרים רפואיים אחרים?

הדגש כאן הוא על יצירת מודל זהיר שמודה כשאין לו תשובה או כשהמידע לא שלם. המאגר כולל רשומות מיוחדות של הטעיות, פניות לא רפואיות ושאלות שמאלצות את המערכת להצהיר שאינה מחליפה טיפול מקצועי, במטרה למנוע הזיות.

איך טוענים

הנתונים יושבים בקובץ medtext_2.csv שזמין להורדה ישירה בלי צורך באישור גישה מיוחד. מדובר בקובץ יחיד ומעורבב שמכיל את כל הדוגמאות, כך שטעינה שלו דורשת בסך הכל פקודה פשוטה בסיסית בפנדס או בספריית הדאטהסטים של הגינג פייס. בגלל שמדובר באלף רשומות בלבד, הקובץ שוקל מעט מאוד ולא דורש משאבי חישוב כבדים כדי לפתוח אותו או לעבוד איתו מקומית. לפני שמתחילים לאמן, כדאי לבדוק את מבנה העמודות כדי לראות איך מופרדים תיאור המקרה והתשובה של הרופא.

from datasets import load_dataset

ds = load_dataset("BI55/MedText")

הרישיון

הרישיון המדווח הוא cc-by-4.0. המשמעות היא שמותר להשתמש במידע למטרות מחקר וגם לפרויקטים מסחריים, כולל שינוי של הטקסטים ואימון מודלים עליהם. התנאי המרכזי הוא מתן קרדיט ברור ליוצר המקורי BI55. אין חובה לשתף את המודל המאומן או את הנגזרות באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗