GPT
M

medical

קוד פתוח

shibing624apache-2.02023-05-22

  • text-generation

אוסף רחב של נתוני רפואה בסינית ובאנגלית שמיועד לאימון מלא של מודלי שפה, החל מקדם אימון, דרך כוונון הוראות ועד מודל תגמול.

  • 2,305הורדות בחודש
  • 441לייקים

מה זה

המאגר מאגד נתונים מכמה מקורות חיצוניים ומחלק אותם לשלושה שלבי אימון שונים. החלק של קדם האימון מכיל קובץ אנציקלופדיה של כ־360 אלף רשומות המורכבות משרשור שאלות ותשובות ממאגר huatuo_encyclopedia_qa, לצד 8,475 פסקאות מספרי לימוד רפואיים שמקורם בפרויקט MedQA ונחתכו למקטעים של עד 2,048 תווים.

חלק הכוונון העדין כולל קובץ בסינית עם כמעט שני מיליון דוגמאות שנאספו מדיאלוגים רפואיים בשישה תחומים, מאנציקלופדיה ומגרף ידע רפואי, ובנוסף קובץ באנגלית עם כ־116 אלף דוגמאות שנלקחו ממאגרי ChatDoctor, HealthCareMagic ו־GenMedGPT.

החלק השלישי מיועד לאימון מודלי תגמול ומכיל 4,000 שאלות שנבחרו באקראי. כל רשומה בחלק זה מציגה את שאלת המטופל, מענה מועדף שנלקח מתשובת רופא אמיתי, ומענה דחוי שנוצר על ידי המודל Huatuo-Llama-Med-Chinese.

מתאים ל

  • אימון מודל דיאלוג רפואי

    אימון מודלי שפה על כמעט שני מיליון שיחות והוראות רפואיות בסינית.

  • אימון מודל תגמול לרפואה

    כיול העדפות במודלים באמצעות 4,000 זוגות של תשובות רופא לעומת תשובות מודל.

  • הזרקת ידע בקדם אימון

    העשרת אוצר המילים והידע הרפואי מתוך מאות אלפי פסקאות אנציקלופדיה וספרות מקצועית.

איפה זה נופל

המאגר ממוקד כמעט לחלוטין ברפואה בשפה הסינית עם תוספת מוגבלת באנגלית, ואין בו שום ייצוג לעברית או להתאמה למערכת הבריאות בישראל. הנתונים מתבססים על שרשור של שאלות ותשובות וסריקות ישנות מ־2023 ומאגרים קודמים, בלי דיווח על בקרת איכות קלינית או אימות ידני של המידע הרפואי. לא הייתי משלב את המידע הזה בשירות רפואי אמיתי בלי בדיקה של רופא, בייחוד כשתשובות המודל שנפסלו בחלק התגמול ממחישות את הסיכון להזיות.

שאלות
נפוצות

האם המאגר מתאים לפיתוח מערכת רפואית בעברית?

לא. המאגר מכיל נתונים בסינית בלבד עם חלק מסוים באנגלית. אין בו נתונים בעברית והוא אינו מכיר את המונחים או ההנחיות של מערכת הבריאות המקומית.

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

הרישיון המוצהר בדף הוא Apache 2.0, שמתיר שימוש מסחרי מלא באימון מודלים. עם זאת, הנתונים לוקטו ממאגרי רשת ומספרי לימוד חיצוניים, ולכן יש לוודא שהתנאים של המקורות הראשוניים לא סותרים זאת.

מה מייחד את המאגר לעומת אוספי שיחות רפואיים אחרים?

הוא מספק חבילה שלמה לכל תהליך האימון תחת קורת גג אחת. במקום לאסוף בנפרד טקסטים לקדם אימון, דוגמאות להוראות וזוגות העדפה ל־RLHF, הנתונים כבר מחולקים ומסודרים לפי שלבי העבודה של MedicalGPT.

איך טוענים

טוענים את הקבצים ישירות דרך ספריית datasets באמצעות הסקריפט medical.py או על ידי קריאת קובצי ה־JSON הייעודיים לכל משימה. אין צורך בבקשת גישה מיוחדת או באישור ידני, המאגר פתוח להורדה מיידית. שימו לב שהנתונים מחולקים למבנים שונים: בקדם האימון יש שדה text בלבד, בכוונון ההוראות עובדים עם instruction, input ו־output, ובחלק התגמול השדות הם question, response_chosen ו־response_rejected.

from datasets import load_dataset

ds = load_dataset("shibing624/medical")

הרישיון

המאגר מופץ ברישיון Apache 2.0 שמתיר שימוש מסחרי, שינוי והפצה, ומאפשר לאמן מודלים בלי חובה לפתוח את הקוד שלכם. חובה לצרף עותק של הרישיון והודעת ייחוס למחבר. יש לקחת בחשבון שהמאגר נשען על מקורות צד שלישי כמו ספרי לימוד ודיאלוגים ברשת, ולכן מומלץ לבדוק את תנאי המקורות הללו לפני שיווק מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗