GPT
S

synthetic-healthcare-admissions

קוד פתוח

strova-aiapache-2.02025-08-26

  • synthetic-data
  • healthcare-dataset
  • generate-synthetic-data
  • dataset-for-llm-training
  • hospital-admissions

נתוני אשפוז סינתטיים לחלוטין שמדמים רשומות רפואיות של חולים, כולל אבחנות ועלויות. מיועד למי שרוצה להתאמן על מודלים רפואיים בלי להסתבך עם פרטיות ורגולציה של מידע אמיתי.

  • 215הורדות בחודש
  • 237לייקים

מה זה

המאגר כולל בין אלף לעשרת אלפים רשומות של קבלת חולים לבתי חולים, שנוצרו כולן באמצעות הכלי Syncora.ai. כל שורה מייצגת מקרה אשפוז ומכילה פרטים דמוגרפיים כמו גיל ומגדר, לצד נתונים קליניים ומנהליים: סוג דם, אבחנה רפואית, סוג האשפוז, תרופות שניתנו, תוצאות בדיקות מעבדה וסכום החיוב בדולרים.

רוב המשתנים הקטגוריאליים בדאטהסט כבר מומרים למספרים. המגדר מקודד לאפס ואחת, סוגי הדם מקודדים כמספרים מאפס עד שבע, וסוגי האשפוז מחולקים לשלוש קטגוריות: חירום, דחוף ואלקטיבי. גם האבחנות, התרופות ותוצאות הבדיקות מופיעות כערכים מספריים מקודדים. המאגר מכיל קובץ CSV ראשי לצד מחברת פייתון שמדגימה שימוש.

מתאים ל

  • חיזוי עלויות אשפוז

    בניית מודלי רגרסיה להערכת גובה החיוב הכספי של המטופל לפי גיל, סוג אשפוז ואבחנה.

  • סיווג דחיפות קבלה

    אימון מודלים לסיווג אוטומטי של סוג האשפוז בין חירום, דחוף או אלקטיבי.

  • הדגמות והוכחות היתכנות

    בדיקת פייפליינים של עיבוד נתונים רפואיים בלי להסתכן בחשיפת מידע חסוי של חולים אמיתיים.

איפה זה נופל

זהו מידע סינתטי במאה אחוז, והכרטיס לא מפרט על בסיס איזה דאטה אמיתי האלגוריתם כויל, אם בכלל. כל הקידודים הפנימיים כמו תרופות או אבחנות מופיעים כמספרים שרירותיים בלי מילון מונחים מלא שמסביר איזה מספר מייצג איזו מחלה. הנתונים באנגלית בלבד וכוללים חיובים בדולרים לפי שיטת התמחור האמריקאית, כך שאין שום התאמה למערכת הבריאות הישראלית. לא הייתי משתמש בזה למודל קליני אמיתי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן. הרישיון הוא apache-2.0, שמאפשר שימוש מסחרי מלא ללא תמלוגים. החובה היחידה היא לכלול את תנאי הרישיון והקרדיט למפתחים בתוכנה או במוצר.

האם הנתונים מתאימים למערכות בישראל?

לא במיוחד. הדאטה מבוסס על שדות באנגלית ומערכת חיוב אמריקאית בדולרים, ושונה מאוד מהמבנה הנהוג בקופות החולים ובבתי החולים בארץ. אין כאן שום מידע בעברית.

איך המידע הזה נאסף בפועל?

המידע לא נאסף מחולים אמיתיים. הוא נוצר כולו באופן סינתטי באמצעות פלטפורמת Syncora.ai, במטרה לדמות תהליכי אשפוז רפואיים תוך עמידה בכללי פרטיות.

מה המשמעות של המספרים בעמודות האבחנות והתרופות?

העמודות האלה עברו קידוד מספרי מראש, אך כרטיס המאגר לא מצרף מילון מלא שמסביר איזה מספר שייך לאיזו מחלה או תרופה ספציפית. תצטרכו להסתמך על הערכים כקטגוריות מופשטות בלבד.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון או מורידים את קובץ ה־CSV מהמאגר. אין שום צורך באישור גישה מיוחד, וההורדה מיידית. שימו לב שהנתיב שמצוין בדוגמת הקוד של המפרסמים משתמש במזהה syncora במקום strova-ai, כך שכדאי לוודא שאתם פונים למזהה הנכון. כדאי להביא בחשבון שרוב העמודות הן מספרים מקודדים, כך שתצטרכו למפות אותם למשמעויות קליניות אם אתם בונים מודל שפה.

from datasets import load_dataset

ds = load_dataset("strova-ai/synthetic-healthcare-admissions")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי ומחקר חופשי, ומאפשר לשנות את הנתונים, להפיץ אותם מחדש ולאמן עליהם מודלים ללא תשלום. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון ייחוס למפרסמים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗