GPT
C

Chinese-medical-dialogue

קוד פתוח

ticoAgapache-2.02023-08-18

שיחות רפואיות בסינית בסבב יחיד בין חולים לרופאים, שעובדו לפורמט אימון הוראות. מאגר ממוקד למי שבונה מודלים לתשאול או מענה רפואי בסינית.

  • 495הורדות בחודש
  • 71לייקים

מה זה

המאגר מבוסס על פרויקט קוד פתוח קיים בשם Chinese-medical-dialogue-data, ומכיל שיחות ייעוץ רפואי בסבב בודד. בנתוני המקור המידע חולק למחלקה רפואית, כותרת, שאלת המטופל ותשובת הרופא. רואים שם פניות מתחומים כמו קרדיולוגיה ואנדוקרינולוגיה, עם שאלות על תזונה, סוכרת ותרופות.

היוצר עיבד את הטקסטים לתבנית אימון מוכרת של הוראה, קלט ופלט. הכותרת המקורית הפכה להוראה, שאלת המטופל נכנסה לקלט, ותשובת הרופא משמשת כפלט הרצוי, כאשר שדה ההיסטוריה נשאר ריק. הכרטיס לא מציין תהליכי סינון, ניקוי או הסרת פרטים מזהים שנעשו מעבר לשינוי המבנה הזה.

מתאים ל

  • כוונון מודלים בסינית

    אימון מודלי שפה על שאלות ותשובות רפואיות בסינית לפי פורמט הוראות מוכן.

  • סיווג פניות לפי מחלקות

    זיהוי תלונות של חולים ושיוך שלהן לתחומי טיפול רפואיים שונים.

  • בדיקת מודלים קיימים

    הערכת היכולת של מודל קיים לענות על שאלות רפואיות שנכתבו בידי משתמשים.

איפה זה נופל

הנתונים כולם בסינית בלבד, ואין פה מילה בעברית או באנגלית. הכרטיס לא מפרט מי הרופאים שענו, מתי המידע נאסף ואיך אומתו התשובות מבחינה מקצועית. בגלל שמדובר בייעוץ רפואי שנלקח מרשת חיצונית, שימוש בחומר הזה למענה קליני אמיתי דורש בדיקה ידנית מעמיקה של איכות ההנחיות והתאמתן לפרוטוקולים עדכניים.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן, הרישיון המדווח הוא apache-2.0 והוא מתיר שימוש מסחרי מלא. אתם צריכים רק לוודא שאתם משאירים את הצהרת זכויות היוצרים והרישיון המקורי. אין חובה לפתוח את הקוד של המוצר שלכם.

האם יש בדאטהסט תמיכה בעברית?

לא, המאגר כולו בסינית בלבד ומבוסס על שאלות ותשובות מהרשת בסין. כדי להשתמש בו לקהל ישראלי תצטרכו לתרגם את כולו, תהליך שעלול להכניס שגיאות רפואיות קריטיות.

מאיפה הגיעו הנתונים במקור?

היוצר מציין שהנתונים עובדו מתוך מאגר גיטהאב בשם Chinese-medical-dialogue-data. מעבר לקישור הזה, כרטיס הדאטהסט לא מפרט באילו אתרים או בתי חולים נאספו השיחות במקור.

כמה קבצים יש במאגר ואיך הם מאורגנים?

המאגר מכיל שלושה קבצים בלבד, כשהתוכן עצמו נמצא בקובץ JSON יחיד. המבנה מותאם ישירות לאימון מודלי הוראות ומכיל שדות של instruction, input ו־output.

איך טוענים

אתם מושכים את הנתונים ישירות דרך הספרייה של Hugging Face בלי צורך בהרשאות גישה מיוחדות. כל המידע יושב בקובץ JSON יחיד בתיקיית data לצד התיעוד הבסיסי. המבנה פשוט מאוד וכולל את השדות instruction, input ו־output, כך שאין צורך בעיבוד מקדים מורכב לפני הזנה לאימון.

from datasets import load_dataset

ds = load_dataset("ticoAg/Chinese-medical-dialogue")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה של הקוד והנתונים. אתם נדרשים לשמור על הקרדיט והודעת הרישיון המקורית. הרישיון לא מחייב אתכם לשחרר מודלים שאימנתם תחת אותו רישיון, מה שמקל על שילוב שלו במוצרים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗