GPT
E

empathetic_dialogues

קוד פתוח

facebookcc-by-nc-4.02022-03-02

שיחות שמתמקדות בהבעת אמפתיה לפי הקשר רגשי מוגדר. המאגר מתאים למי שרוצה לאמן או לבחון מודל שיחה שמתייחס ישירות לתחושות של הצד השני.

  • 2,199הורדות בחודש
  • 133לייקים

מה זה

המאגר כולל עשרות אלפי תורות שיחה באנגלית, שנוצרו במסגרת מחקר של מטא מ־2018 שפורסם ב־ACL 2019. כל רשומה מייצגת משפט יחיד בשיחה וכוללת מזהה שיחה, מזהה דובר, את תוכן האמירה, הקשר רגשי מוגדר מראש כמו עצב או נוסטלגיה, ופרומפט שממנו הדובר התחיל את הסיטואציה. שדות נוספים כוללים הערכה עצמית ותגיות.

הנתונים מחולקים לשלושה חלקים מוכנים. חלק האימון מכיל 76,673 רשומות, חלק הוולידציה כולל 12,030 רשומות, וחלק הבחינה כולל 10,943 רשומות. כרטיס המאגר לא מפרט כיצד נאספו הנתונים, מיהם הדוברים או מה היו שיטות הסינון והנרמול.

מתאים ל

  • אימון צ'אטבוטים לאמפתיה

    כוונון עדין של מודלי שיחה כדי שילמדו לזהות מצב רגשי ולהגיב ברגישות מתאימה.

  • מבחן ביצועים לשיחה רגשית

    הערכת היכולת של מודלים קיימים להפיק תגובות מותאמות להקשר לפי חלוקת הבחינה.

  • סיווג רגש מתוך שיחה

    שימוש בטקסט ובשדה ההקשר לבניית מודלים שמזהים את מצב הרוח של הדובר.

איפה זה נופל

הכרטיס ריק מפרטים בכל הנוגע להטיות, סינון פרטים מזהים או מגבלות חברתיות, ומשאיר את רוב הסעיפים תחת דרישת מידע נוסף. כל הטקסט באנגלית בלבד, ואין כאן עברית כלל. בנוסף, מדובר בנתונים ממחקר שהוצג ב־2019, כך שהשפה וההקשרים משקפים את התקופה ההיא. אם אתם בונים על זה שירות חי, תצטרכו לבדוק בעצמכם רגישויות וסגנון תגובה לפני שמשחררים משקלים לעולם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי בחברה?

לא. המאגר מופץ תחת רישיון CC-BY-NC 4.0 שמתיר שימוש לא מסחרי בלבד. מודלים שתאמנו עליו לא יוכלו לשרת מוצר שמייצר הכנסות.

כמה מקום ומשאבים צריך כדי להוריד אותו?

מעט מאוד. קובץ ההורדה שוקל 28.02 מגהבייט, והנפח הכולל בדיסק הוא 53.15 מגהבייט. אפשר להוריד ולעבד אותו על כל מחשב אישי בלי דרישות חומרה חריגות.

האם יש במאגר שיחות בעברית?

לא, כל הנתונים באנגלית בלבד. אם המטרה היא מערכת בעברית, תצטרכו לתרגם את הנתונים או למצוא מקורות אחרים.

איך הנתונים נאספו ונבדקו לפי התיעוד?

כרטיס המאגר לא מספק את המידע הזה, וסעיפי האיסוף והתיוג מסומנים כחסרים. לפרטים על תהליך ההרכבה תצטרכו לפנות ישירות למאמר האקדמי מ־2019.

איך טוענים

טוענים את המאגר ישירות בספריית datasets ללא צורך באישור גישה מיוחד. קובץ ההורדה שוקל 28.02 מגהבייט, והנתונים לאחר פריסה תופסים 25.13 מגהבייט, כך שכל הנפח בדיסק מסתכם ב־53.15 מגהבייט בלבד. השדות המרכזיים שתרצו למשוך הם utterance שמכיל את הטקסט, context להקשר הרגשי, conv_id שמחבר את התורות לרצף שיחה שלם, ו־speaker_idx כדי להבדיל בין הדוברים.

from datasets import load_dataset

ds = load_dataset("facebook/empathetic_dialogues")

הרישיון

הרישיון הוא CC-BY-NC 4.0. המשמעות ברורה: שימוש לא מסחרי בלבד, לצד חובת ייחוס ליוצרים. אסור להשתמש בנתונים במוצר מסחרי, ואימון מודל על המאגר עלול להגביל את היכולת למכור גישה אליו או להפעיל אותו בסביבה עסקית שמניבה הכנסות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗