GPT
W

wiki_medical_terms

קוד פתוח

gaminogpl-3.02022-12-20

  • medical
  • conditions

מעל 6,000 מונחים רפואיים באנגלית עם הטקסט המלא שלהם מתוך ויקיפדיה. זה מתאים למי שצריך מאגר מונחים בסיסי לאימון ראשוני או לסיווג, בלי לקרוא מאמרים אקדמיים כבדים.

  • 357הורדות בחודש
  • 107לייקים

מה זה

המאגר מציע אוסף מרוכז של יותר מ־6,000 מונחים רפואיים שלצידם מופיע המלל שהוצא מעמודי ויקיפדיה המתאימים. הרשומות מיועדות בעיקר למשימות המשך שדורשות שילוב ישיר בין מונח רפואי להסבר הכללי שלו, כמו סיווג טקסטים או מידול שפה בתחום הבריאות.

חוץ מזה שהטקסטים מגיעים מויקיפדיה, הכרטיס המקורי לא מפרט כלום. אין תיעוד של שיטת האיסוף, לא ברור באילו כלים חילצו את המידע, ואין שום מידע על סינון או ניקוי שבוצעו לפני האריזה. גם המבנה המדויק של השדות והחלוקה לחלקים נותרו ריקים לחלוטין בדף התיעוד הרשמי, כך שאי אפשר לדעת מראש אם יש חלוקה מובנית לסט אימון, בדיקה או ולידציה.

מתאים ל

  • סיווג טקסט רפואי

    אימון מסווגים בסיסיים שמזהים מושגים ונושאים בריאותיים בטקסט חופשי באנגלית.

  • טיוב והרחבת מילון מונחים

    חילוץ הגדרות ראשוניות עבור מילונים או מנועי חיפוש בתחום הרפואה הכללית.

  • כיול מודלי שפה לתחום הבריאות

    אימון מקדים קל או בדיקת ביצועים של מודלים על שפה רפואית עממית.

איפה זה נופל

הבעיה המרכזית היא חוסר תיעוד מוחלט בכרטיס המקורי. לא כתוב איך נבחרו 6,000 המונחים, האם המידע עבר בקרת איכות על ידי גורם רפואי מוסמך, ומה תאריך הגרידה המדויק מויקיפדיה. בנוסף, כל החומר מבוסס על אנגלית בלבד, כך שהוא לא יעזור ישירות למי שבונה מודל בעברית. לפני שמכניסים דבר כזה למערכת עובדת, אתם חייבים לדגום את הטקסטים ולוודא שאין בהם עיוותים או חוסר דיוק רפואי שמקורו בעריכות פתוחות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המדווח הוא gpl-3.0, ולכן שימוש מסחרי עלול לחייב אתכם לחשוף את הקוד של המוצר. כדאי להתייעץ עם גורם משפטי לפני שמכניסים אותו לפרויקט שאינו קוד פתוח.

האם הדאטהסט כולל תרגום או תמיכה בעברית?

לא, המאגר כולל אך ורק טקסטים באנגלית שנאספו מויקיפדיה. אם אתם צריכים נתונים בעברית, תצטרכו לתרגם את המונחים או לחפש מקור אחר.

כמה רשומות יש שם ומה הגודל של המאגר?

יש בו מעל 6,000 רשומות שמסודרות בקובץ parquet יחיד לצד קובץ ההסבר. בגלל שמדובר בטקסט בלבד בהיקף הזה, נפח ההורדה קטן מאוד ונטען בשניות בודדות.

האם אפשר לסמוך על המידע מבחינה רפואית מקצועית?

לא מומלץ לקבל החלטות רפואיות על סמך המידע הזה. המקור הוא עמודי ויקיפדיה ציבוריים ולא ברור אם נעשתה בדיקה של רופאים או בקרה מקצועית על הערכים שנאספו.

איך טוענים

טוענים את הדאטהסט ישירות דרך ספריית datasets באנגלית עם המזהה gamino/wiki_medical_terms. הקובץ המרכזי שמכיל את המידע שמור בפורמט parquet, כך שהטעינה שלו לסביבת העבודה מהירה מאוד ולא דורשת משאבים חריגים.

הגישה פתוחה לחלוטין ואין צורך לבקש אישור גישה מוקדם או להמתין למפתח API. כדאי לפתוח את הקובץ ישירות ולבדוק את שמות העמודות לפני שמתחילים לכתוב קוד אימון, כי התיעוד לא מציג את שמות השדות שנוצרו בפועל.

from datasets import load_dataset

ds = load_dataset("gamino/wiki_medical_terms")

הרישיון

הרישיון שדווח במאגר הוא gpl-3.0. זה רישיון קוד פתוח מדבק ומחמיר מאוד. הוא אומר שאם אתם בונים מערכת או מודל שמשתמשים ישירות בנתונים האלה ומפיצים אותם, ייתכן שתחויבו לפתוח את כל קוד המקור שלכם תחת אותו הרישיון בדיוק. לחברות מסחריות שרוצות לשמור על קוד סגור, שימוש במאגר כזה יכול להיות בעייתי מאוד מבחינה משפטית.

הרישיון המלא ב־Hugging Face ↗