GPT
M

MentalChat16K

קוד פתוח

ShenLabmit2024-06-04

  • Mental Health

שיחות ייעוץ ותמיכה נפשית שמחולקות לסינתטיות לחלוטין ולתמלולי שיחות קליניות אמיתיות. זה מתאים למי שבונה מודל שיחה שצריך להכיר שפה של מטופלים ומטפלים.

  • 2,760הורדות בחודש
  • 62לייקים

מה זה

המאגר מכיל שני חלקים עיקריים בקובצי CSV נפרדים. החלק הראשון כולל 9,775 שיחות סינתטיות שנוצרו על ידי GPT-3.5 Turbo עם התאמה של שלד Airoboros, ומכסה 33 נושאים בבריאות הנפש, כמו חרדה, דיכאון, יחסים וקונפליקטים משפחתיים. המודל ייצר גם את שאלות הפונים וגם את תשובות המטפלים לפי חלוקת נושאים מוגדרת מראש.

החלק השני כולל 6,338 צמדי שאלה ותשובה שהופקו מ־378 תמלולי ראיונות של ניסוי קליני פעיל. מדובר בהקלטות של מפגשי התערבות התנהגותית בין מאמני בריאות למטפלים של חולים בהוספיס או טיפול פליאטיבי. התמלילים האלה עובדו וסוכמו באמצעות Mistral-7B-Instruct-v0.2 לשיחה בת סיבוב אחד, תוך סינון של כל צמד שכלל פחות מ־40 מילים בשאלה ובתשובה.

מתאים ל

  • אימון צ'אטבוט תמיכה

    כוונון עדין למודלי שפה כדי שיידעו לנהל דיאלוג ראשוני סביב חרדה, יחסים וקונפליקטים אישיים.

  • הערכת מודלים טיפוליים

    בדיקת יכולת המענה של מודלים קיימים מול תרחישי שיחה מתחום בריאות הנפש והתערבות התנהגותית.

  • מחקר על דאטה סינתטי

    השוואת ביצועים של מודלים שאומנו על שיחות מומצאות לעומת שיחות שמקורן בניסוי קליני אמיתי.

איפה זה נופל

החלק הארי של המאגר סינתטי לחלוטין ונוצר באמצעות פרומפטים, כך שהוא עלול לפספס מורכבויות אנושיות אמיתיות. בנוסף, החלק שמבוסס על הניסוי הקליני עבר תמצות ופרפרזה של מודל שפה ולא מציג את התמליל הגולמי, מה שיוצר שכבת עיבוד סינתטית גם עליו. כל המאגר באנגלית בלבד, ואין פה ייצוג לעברית, לתרבויות שאינן דוברות אנגלית או למערכת הבריאות המקומית. אסור להשתמש בזה למתן ייעוץ רפואי אמיתי ללא בדיקה מעמיקה של התשובות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הדאטהסט מפורסם תחת רישיון MIT, שמתיר שימוש מסחרי מלא כולל שילוב במוצרים סגורים. יש רק להקפיד לצרף את תנאי הרישיון המקוריים במסמכי התוכנה שלכם.

האם הנתונים כוללים עברית?

לא. כל השיחות והתמלילים במאגר נוצרו ונאספו באנגלית בלבד. אם היעד הוא משתמשים ישראלים, תצטרכו לתרגם את הנתונים או להשתמש בהם לאימון מודל רב לשוני קיים.

מאיפה הגיעו הנתונים של הראיונות?

מניסוי קליני שנערך עם מטפלים של חולים במסגרות הוספיס וטיפול פליאטיבי. ההקלטות תומללו על ידי מומחים, ואז עובדו וסוכמו לצמדי שאלה ותשובה באמצעות Mistral-7B-Instruct-v0.2 תוך סינון תשובות קצרות מ־40 מילים.

באיזה פורמט המידע שמור ואיך ניגשים אליו?

המידע שמור בשני קובצי CSV מרכזיים, אחד לחלק הסינתטי ואחד לנתוני הראיונות. הגישה חופשית לגמרי דרך Hugging Face ואין צורך לבקש אישור גישה מוקדם.

איך טוענים

הנתונים מגיעים בקובצי CSV פתוחים להורדה ישירה דרך Hugging Face ללא צורך בהרשמה מיוחדת או אישור גישה. הקבצים המרכזיים לעבודה הם Synthetic_Data_10K.csv ו־Interview_Data_6K.csv, כך שאפשר לטעון אותם בספריית datasets הרגילה או ישירות עם פנדס. החלוקה לשני קבצים שונים דורשת לשים לב למבנה העמודות בכל אחד, במיוחד כשרוצים למזג את הטקסט הסינתטי עם הנתונים שנגזרו מהניסוי הקליני.

from datasets import load_dataset

ds = load_dataset("ShenLab/MentalChat16K")

הרישיון

הרישיון המדווח הוא MIT. זהו רישיון מתירני שמאפשר שימוש מסחרי ומחקרי, שינוי של המידע והפצה שלו, ואינו מחייב אתכם לשחרר מודל שאומן עליו תחת אותו רישיון. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗