GPT
C

ChatMed_Consult_Dataset

קוד פתוח

michaelwzhucc-by-4.02023-04-20

  • medical consultation
  • finetuning

מעל 110 אלף שאלות רפואיות אמיתיות מסין עם תשובות סינתטיות של מודל שפה. מי שמאמן מודל שיחה רפואי בסינית ימצא פה נפח עבודה ראשוני מוכן.

  • 287הורדות בחודש
  • 142לייקים

מה זה

המאגר מכיל 110,113 צמדים של שאלות ותשובות רפואיות בסינית. השאלות נאספו בסריקה מאתרי ייעוץ רפואי ברשת, כך שהן מציגות פניות אותנטיות של משתמשים וחולים אמיתיים עם בעיות מגוונות. התשובות לא נכתבו בידי רופאים אלא נוצרו במלואן באמצעות GPT-3.5 של OpenAI.

המבנה של הרשומות ישיר לגמרי, פורמט שורות ג'ייסון שכולל רק שני שדות: שאלה ותשובה. כל הנתונים יושבים בחלוקה יחידה של אימון, בלי ספליטים מובנים להערכה או מבחן, והכרטיס מציין שהסינון של תשובות רופאים מקוריות מול חולים אמור היה לקרות בעתיד ולא בוצע בגרסה הזו.

מתאים ל

  • אימון בסיס לייעוץ בסינית

    הזרקת ידע רפואי וסגנון פנייה קליני למודלי שפה שמתמחים בשיחה בסינית.

  • מחקר על הזיות רפואיות

    בדיקת מידת הדיוק והשגיאות של GPT-3.5 מול שאלות בריאות מורכבות בעולם האמיתי.

  • סינון וטיוב תשובות

    בניית שיטות אלגוריתמיות לזיהוי והסרה של פלטים שגויים מתוך מאגרים סינתטיים.

איפה זה נופל

זה מאגר בסינית בלבד, בלי מילה אחת בעברית או באנגלית, כך שלמוצר ישראלי מקומי הוא לא רלוונטי ישירות. הבעיה המרכזית היא שכל המידע הרפואי נוצר על ידי GPT-3.5, והיוצרים עצמם מודים שהוא מכיל שגיאות והטיות בלתי נמנעות. אין כאן בדיקה של איש מקצוע אנושי, חסר מידע על סינון פרטים אישיים של השואלים, וההסתמכות עליו כבסיס לייעוץ קליני מסוכנת מאוד.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא כדאי להסתכן. אף שבראש העמוד מופיע רישיון חופשי יחסית, בגוף התיעוד נכתב בבירור רישיון NC שאוסר שימוש מסחרי. מעבר לזה, התשובות הופקו במנוע של OpenAI, מה שמוסיף מגבלות שימוש משפטיות על אימון מודלים מסחריים.

האם יש במאגר שאלות או תשובות בעברית?

לא. כל הנתונים, גם השאלות שנאספו וגם התשובות שנוצרו, כתובים בסינית בלבד. אם המטרה שלכם היא אימון בעברית, תצטרכו לתרגם את כולו או לחפש מקור אחר.

איך נוצרו התשובות והאם רופא בדק אותן?

השאלות נלקחו מאתרי רפואה ברשת, אבל התשובות יוצרו כולן על ידי GPT-3.5. הכרטיס לא מציין בדיקה או אימות של רופאים אנושיים, ומזהיר שהטקסט כולל שגיאות והטיות שדורשות סינון זהיר.

האם יש חלוקה מובנית לסט בדיקה ואימות?

לא. כל 110,113 הרשומות נמצאות תחת קובץ אימון יחיד. מי שרוצה לבצע הערכה מדויקת יצטרך לפצל בעצמו חלק מהשורות לטובת בדיקה לפני תחילת העבודה.

איך טוענים

טוענים את הקובץ ישירות מפורמט ג'ייסון, למשל דרך ChatMed_Consult-v0.3.json. המאגר פתוח לגישה ציבורית מיידית ללא צורך בהרשאות מיוחדות או אישור מול Hugging Face. העבודה מולו פשוטה מאוד כי אין מטא-דטה מורכב, פשוט רצים על השדות query ו־response בלולאת אימון רגילה של יצירת טקסט.

from datasets import load_dataset

ds = load_dataset("michaelwzhu/ChatMed_Consult_Dataset")

הרישיון

יש פה בלבול ברישיונות שחובה לשים לב אליו. במטא-דטה מוגדר רישיון cc-by-4.0 שמתיר שימוש מסחרי, אבל בטקסט עצמו היוצר ציין במפורש CC BY-NC 4.0 שאוסר מסחר. בנוסף, הנתונים נוצרו ב־OpenAI, מה שמגביל אימון מודלים מתחרים. מודל שתאמנו עליו לא בטוח חוקי להפצה מסחרית.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗