GPT
M

mental_health_chatbot_dataset

קוד פתוח

heliosbrahmamit2023-08-02

  • medical

שיחות שאלות ותשובות בנושאי בריאות הנפש שמיועדות לאימון צ׳אטבוטים תומכים. הוא מתאים למי שמחפש טקסטים רפואיים מנוסחים היטב ממקורות מקוונים מוכרים.

  • 308הורדות בחודש
  • 94לייקים

מה זה

המאגר מכיל צמדי שיחה של שאלות מטופלים ותשובות של אנשי צוות רפואי, כולם בתחום בריאות הנפש. המידע נאסף מבלוגים רפואיים מוכרים כמו WebMD, Mayo Clinic ו־HealthLine, לצד מאגרי שאלות ותשובות נפוצות ברשת. כל רשומה כוללת עמודת טקסט אחת שמחזיקה את חילופי הדברים המלאים בין השואל למשיב.

לפי התיעוד, הטקסטים עברו ניקוי שכלל הסרת תווים מיותרים ומחיקת פרטים מזהים כדי להגן על פרטיות. אין כאן חלוקה מורכבת לסטים שונים של אימון או בדיקה, אלא קובץ יחיד שמרכז את כל הנתונים הגולמיים ברצף אחד. המבנה הפשוט הזה מתמקד בהצגת דיאלוג רפואי ישיר, בדיוק כפי שנכתב באתרים מהם נלקח.

מתאים ל

  • כוונון עדין לבוט תמיכה

    אימון ראשוני של מודל שפה לייצור תשובות אמפתיות לשאלות בסיסיות בבריאות הנפש.

  • בדיקת התאמת שיח רפואי

    בחינת יכולת המודל לייצר ניסוח מקצועי שמבוסס על שאלות מטופלים נפוצות.

  • בניית מאגר שאלות ותשובות

    חילוץ תבניות שיחה נפוצות לצורך שילוב במערכות מידע ומענה אוטומטי.

איפה זה נופל

גודל המאגר קטן מאלף רשומות, כך שהוא לא יספיק לבדו לאימון מלא אלא לכל היותר לכוונון עדין מאוד או לבדיקת היתכנות. המידע קיים באנגלית בלבד ואינו רלוונטי ישירות למי שבונה שירות בעברית. בנוסף, הנתונים לוקטו מבלוגים ומאתרי אינטרנט ציבוריים, כך שהם עלולים להכיל תשובות כלליות שאינן מתאימות למצבי חירום נפשיים אמיתיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא MIT ולכן אין מניעה חוקית לשלב אותו במוצרים מסחריים. תצטרכו רק לצרף את תנאי הרישיון המקוריים לקוד שלכם.

האם יש בדאטהסט תמיכה בעברית?

לא, כל הטקסטים נאספו באנגלית בלבד. כדי להשתמש בו לקהל ישראלי תצטרכו לתרגם את הנתונים או לחפש מקור מקביל.

מאיפה הגיעו הנתונים שבמאגר?

הנתונים נלקחו מאתרים ובלוגים רפואיים מוכרים כמו Mayo Clinic, WebMD ו־HealthLine. הם עברו עיבוד להסרת תווים מיותרים ומחיקת פרטים מזהים.

כמה רשומות יש בו והאם הוא מתאים לאימון מלא?

המאגר קטן מאוד ומכיל פחות מאלף רשומות. הוא לא יספיק לאימון מודל מאפס, אלא רק לניסויים קטנים או כתוספת קלה לכוונון עדין.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה של Hugging Face בלי צורך בהרשאות גישה או בטופסי אישור. המאגר קטן מאוד, פחות מאלף רשומות בסך הכל, ויושב בקובץ Parquet בודד. יש בו שדה יחיד בשם text, ולכן אם תרצו להפריד בין שאלת המשתמש לתשובת המטפל, תצטרכו לכתוב סקריפט פיצול קצר בעצמכם.

from datasets import load_dataset

ds = load_dataset("heliosbrahma/mental_health_chatbot_dataset")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי ומחקר ללא תשלום, ומאפשר לשנות את הנתונים ולשלב אותם בכל פרויקט. החובה היחידה היא לשמור על הודעת זכויות היוצרים של היוצר המקורי. מודל שתאמנו על הדאטהסט לא כבול למגבלות שיתוף מיוחדות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗