GPT
A

all-human-diseases

קוד פתוח

nistenagpl-3.02024-08-13

המאגר מרכז רשימת טיוטה של מחלות ומצבים רפואיים באדם ממקורות ציבוריים. מי שבונה מילון מונחים רפואי או צריך נרמול ראשוני של שמות מחלות ימצא פה בסיס שטוח לעבודה.

  • 69הורדות בחודש
  • 108לייקים

מה זה

מדובר בקובץ טיוטה מסוג CSV שפורסם באוגוסט 2024, ומכיל ריכוז של שמות מחלות ומצבים רפואיים. לפי הכרטיס, הנתונים לוקטו ממספר מקורות רשת ציבוריים: עמודי נושאי הבריאות של ה־CDC, ארכיון רשת של רשימת מחלות מאתר ויסטה אינפורמטיקס, וארבע רשימות שונות מוויקיפדיה באנגלית שעוסקות במחלות זיהומיות, שיעורי תמותה, גורמי מוות ומחלות החייבות בדיווח.

היוצר מדגיש שהעבודה מתבססת על רפואה מדעית מבוססת ראיות בלבד ומבקש להימנע מדעות אישיות. התיעוד לא מפרט תהליך סינון שיטתי, ניקוי כפילויות או סכמה מובנית מעבר לקובץ הטבלאי הבודד. קיים גם קישור לגוגל שיטס לשיתוף הערות ותיקונים מהקהילה.

מתאים ל

  • בניית מילון ישויות רפואיות

    זיהוי ומיפוי של שמות מחלות ומצבים רפואיים באנגלית מתוך טקסטים חופשיים.

  • נרמול שמות מחלות

    בסיס התחלתי להאחדת שמות של מחלות שונות מתוך רשימות מקור מרובות.

  • אימון מודלי שפה בסיסיים

    טיוב ראשוני של טקסט רפואי עבור מודלים שצריכים היכרות עם שמות מצבים בריאותיים.

איפה זה נופל

זהו קובץ טיוטה מוצהר, והיוצר מציין שמידע נוסף אמור להגיע בהמשך. המקורות באנגלית בלבד, כך שאין שום תמיכה מובנית בעברית, במינוח מקומי או בקידודים רפואיים מקובלים כמו ICD. חלק מהנתונים מבוססים על ערכי ויקיפדיה וארכיון רשת מ־2017, מה שעלול לכלול מידע לא מעודכן או חלקי. לא הייתי מכניס את זה למערכת קלינית בלי בדיקה ידנית יסודית של כל רשומה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

הרישיון המוגדר הוא AGPL-3.0, רישיון קוד פתוח תובעני שמחייב שחרור קוד במקרה של מתן שירות ברשת. למרות שהיוצר ציין בטקסט שאין לו בעיה עם שימוש של סטארטאפים, ההגדרה המשפטית המחייבת בקובץ היא AGPL. עבור חברות שבונות תוכנה קניינית סגורה, מדובר בסיכון משפטי ברור.

האם יש ברשימה תמיכה בשפה העברית?

אין בדאטהסט שום מידע בעברית. כל המקורות שצוינו, כולל ה־CDC ודפי ויקיפדיה, הם באנגלית בלבד. אם המערכת שלכם פונה לקהל ישראלי או דורשת שמות מחלות בעברית, תצטרכו לתרגם ולמפות הכל בעצמכם מול מונחי משרד הבריאות.

איך נאספו הנתונים והאם הם עברו בקרת איכות?

הנתונים לוקטו מרשימות ציבוריות בוויקיפדיה, דפי ה־CDC ועמוד ארכיון רשת מ־2017. לא מתועד תהליך ביקורת עמיתים או ולידציה קלינית רשמית, והיוצר עצמו מגדיר את הקובץ כטיוטה ומבקש תיקונים מהציבור. לכן אי אפשר להסתמך עליו כמקור רפואי סמכותי ללא אימות עצמאי.

מה הדאטהסט הזה כולל בפועל מבחינת קבצים?

המאגר כולל שלושה קבצים בלבד, כשהעיקרי בהם הוא קובץ CSV בודד שפורסם באוגוסט 2024. הקובץ מכיל שמות של מחלות ומצבים רפואיים לצד קישור לגוגל שיטס לטובת משוב. אין כאן חלוקה מובנית לסטים של אימון ובדיקה או קבצי קוד נלווים.

איך טוענים

אתם מושכים את הקובץ ישירות מ־Hugging Face, אין צורך בבקשת גישה מיוחדת. המאגר כולל שלושה קבצים בלבד, כשהמידע המרכזי יושב בקובץ draft_list_of_all_human_diseases_and_conditions_august_2024.csv. אפשר להוריד אותו ידנית או לטעון עם ספריית datasets או pandas כקובץ טבלאי רגיל. מבנה העמודות המדויק לא מתועד בכרטיס, לכן כדאי לפתוח את השורות הראשונות ולבדוק את שמות השדות לפני שמשלבים אותו בקוד אימון.

from datasets import load_dataset

ds = load_dataset("nisten/all-human-diseases")

הרישיון

הרישיון הרשמי הוא AGPL-3.0. מדובר ברישיון מדבק, כך שאם אתם משתמשים בו במערכת שמספקת שירות ברשת, אתם עלולים להידרש לחשוף את קוד המקור של המערכת כולה תחת אותו רישיון. היוצר כתב בתיעוד שלא אכפת לו שסטארטאפים ישתמשו בזה, אבל מבחינה משפטית הרישיון הקובע במאגר הוא AGPL, ואי אפשר להתעלם ממנו בפיתוח מסחרי סגור.

הרישיון המלא ב־Hugging Face ↗