GPT
S

symptom_to_diagnosis

קוד פתוח

gretelaiapache-2.02023-05-23

  • medical

תיאורי תסמינים באנגלית בשפה טבעית מול 22 אבחנות רפואיות מתאימות. המאגר נבנה כדי לאמן מודלים לקשר בין תלונות של מטופלים למחלות ספציפיות.

  • 3,542הורדות בחודש
  • 51לייקים

מה זה

המאגר מכיל בסך הכל 1,065 רשומות, ומבוסס במקור על הדאטהסט Symptom2Disease מקגל. היוצרים סיננו ממנו קטגוריות לא רצויות, והשתמשו במודל שפה כדי לשכתב את התסמינים כך שיישמעו כמו אדם אמיתי שמתאר את מה שהוא מרגיש לרופא שלו.

המבנה של הנתונים פשוט מאוד וכולל שני שדות טקסט בלבד: שדה הקלט עם תיאור התסמינים, ושדה הפלט עם שם האבחנה הרפואית באנגלית. החלוקה הפנימית עומדת על 80 אחוז לאימון עם 853 דוגמאות, ו־20 אחוז לבדיקה עם 212 דוגמאות.

יש כאן 22 אבחנות שונות, ביניהן סוכרת, מלריה, דלקת מפרקים, יתר לחץ דם, פסוריאזיס וסוגי זיהומים. לרוב האבחנות יש בדיוק 40 דוגמאות אימון וכעשר דוגמאות בדיקה, כאשר המספר הנמוך ביותר עומד על 32 דוגמאות אימון למיגרנה.

מתאים ל

  • סיווג תלונות ראשוני

    אימון מסווג טקסט שממיין פניות ראשוניות של מטופלים לפי 22 מחלות מוגדרות.

  • בדיקת מודלים קטנים

    בנצ'מרק מהיר למודלי שפה על משימת סיווג טקסט רפואי קצר, בזכות גודל קובץ זעיר.

  • הדגמת ממשקי בריאות

    בניית אבות טיפוס לצ'אטבוטים רפואיים שמנתבים משתמש לפי תיאור תסמינים.

איפה זה נופל

זה לא מאגר שמתאים לבניית כלי רפואי אמיתי. הוא מוגבל ל־22 אבחנות בלבד, מכיל קצת יותר מאלף דוגמאות, והטקסט עבר שכתוב סינתטי באמצעות מודל שפה ולא נלקח ישירות משיחות אמיתיות בין חולים לרופאים. בנוסף, כל הנתונים באנגלית בלבד. אם אתם עובדים מול משתמשים ישראלים או צריכים אבחון קליני אמין בעברית, הנתונים האלה לא יעזרו בלי תרגום והתאמה מהותית, ובכל מקרה חסר בהם עומק של תיקים רפואיים מורכבים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט במוצר מסחרי?

כן, הרישיון הוא Apache 2.0 שמאפשר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים ולהשתמש בתוצרים במערכות מסחריות, כל עוד אתם כוללים את תנאי הרישיון המקוריים.

כמה המאגר הזה שוקל?

המאגר כולו שוקל כ־209 קילובייט. קובץ האימון שוקל 167 קילובייט וקובץ הבדיקה שוקל 42 קילובייט, כך שהטעינה שלו מיידית ולא דורשת שום משאבי אחסון מיוחדים.

האם יש בדאטהסט תמיכה בעברית?

לא, כל הטקסטים במאגר נכתבו באנגלית בלבד. כדי להשתמש בו בארץ תצטרכו לתרגם את תיאורי התסמינים ואת האבחנות, ולוודא שהניסוחים מתאימים לדרך שבה דוברי עברית מתארים מחלות.

איך הנתונים האלה נאספו ועובדו?

הבסיס הוא מאגר Symptom2Disease מקגל. הצוות סינן מתוכו קטגוריות והעביר את הטקסטים דרך מודל שפה, במטרה לגרום לתיאורים להישמע טבעיים יותר, כמו שיחה בין מטופל לרופא.

איך טוענים

טוענים את הקבצים ישירות כקבצי JSONL מתוך המאגר, שמחולק מראש ל־train.jsonl ו־test.jsonl. המשקל הכולל של שני הקבצים הוא קצת מעל 200 קילובייט, כך שמדובר בהורדה מהירה מאוד שלא דורשת זיכרון מיוחד או אישורי גישה מראש. השדות היחידים שמעניינים אתכם בקוד הם input_text שלוקח את הטקסט החופשי, ו־output_text שמשמש כמחלקת היעד לסיווג.

from datasets import load_dataset

ds = load_dataset("gretelai/symptom_to_diagnosis")

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לפרויקטים מסחריים ומחקריים, לשנות את הנתונים ולשלב אותם בקוד סגור, בלי חובה לשתף את התוצר באותו הרישיון. מודל שאומן על המאגר חופשי לשימוש מסחרי, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗