GPT
D

daily_dialog

קוד פתוח

li2017dailydialogcc-by-nc-sa-4.02022-03-02

  • emotion-classification
  • dialog-act-classification

שיחות יומיומיות באנגלית עם תיוג ידני של כוונת הדובר ורגש בכל תור. הוא מתאים למי שבונה מודל שיחה ומחפש טקסט נקי שנכתב בידי בני אדם ולא גורד מפורומים.

  • 4,979הורדות בחודש
  • 157לייקים

מה זה

המאגר כולל שיחות מרובות תורות שנכתבו בידי בני אדם ועוסקות בנושאים מחיי היומיום, ברמת רעש נמוכה יחסית. כל רשומה מייצגת שיחה שלמה המורכבת מרשימת משפטים, ולכל משפט מוצמדים שני תיוגים שנעשו ידנית: סוג הפעולה התקשורתית כמו מידע, שאלה, הנחיה או התחייבות, והרגש של הדובר מתוך שבעה ערכים אפשריים.

הנתונים מחולקים לשלושה חלקים מוכנים מראש. חלק האימון מכיל 11,118 שיחות, חלק הוולידציה כולל 1,000 שיחות, וחלק הבחינה כולל גם הוא 1,000 שיחות. מעבר להצהרה שהטקסטים נכתבו על ידי בני אדם ומייצגים תקשורת יומיומית, הכרטיס אינו מפרט מאיזה אתרים או מקורות הטקסטים נאספו במקור ומי היו המתייגים.

מתאים ל

  • סיווג רגשות בשיחה

    זיהוי כעס, שמחה או עצב בכל משפט מתוך הקשר של שיחה שלמה.

  • סיווג כוונות תקשורתיות

    אימון מודל להבין אם המשפט הנוכחי הוא שאלה, מסירת מידע או הנחיה.

  • אימון צ'אטבוט מרובה תורות

    למידה של מבנה שיחה טבעי ונקי באנגלית בין שני אנשים לצורכי מחקר.

איפה זה נופל

הנתונים קיימים באנגלית בלבד. אין כאן עברית כלל, ואם אתם מתכננים מוצר מקומי תצטרכו לתרגם את החומר או לאסוף דאטה בנפרד. בנוסף, הכרטיס מודה מראש שהמאגר מיועד למחקר בלבד, והוא משאיר שדות רבים ריקים בלי מידע על הטיות, מקור איסוף הטקסט, או נוכחות של פרטים אישיים ורגישים. העבודה הוצגה במקור בשנת 2017, כך שהסגנון הלשוני והנושאים משקפים את אותה תקופה. כדאי לבדוק ידנית את התיוגים לפני שמשתמשים בהם כבסיס להערכה של מודל אמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC BY-NC-SA 4.0, שכולל הגבלת NC מפורשת שאוסרת כל שימוש למטרות רווח או במוצר מסחרי. החומר מוגדר לשימוש מחקרי בלבד.

האם יש בדאטהסט שיחות בעברית?

לא, השפה היחידה בדאטהסט היא אנגלית. כל השיחות והתיוגים נבנו על בסיס השפה האנגלית בלבד.

כמה מקום המאגר תופס בדיסק?

הוא קטן מאוד. קובץ ההורדה שוקל 4.48 מגה בייט, והנתונים המעובדים תופסים בסך הכל 13.11 מגה בייט על הדיסק.

מאיפה נאספו השיחות במקור?

כרטיס המאגר לא מפרט את מקור האיסוף המדויק ומשאיר את השדה הזה ריק. היוצרים מציינים רק שמדובר בטקסטים שנכתבו על ידי בני אדם ומשקפים שיח יומיומי.

איך טוענים

טוענים אותו ישירות דרך הספרייה באמצעות המזהה li2017dailydialog/daily_dialog. המאגר פתוח לכולם ואינו דורש אישור גישה מיוחד. קובץ ההורדה שוקל 4.48 מגה בייט, ובסך הכל הוא תופס כ־13.11 מגה בייט על הדיסק, כך שהוא נטען ונשמר בשניות ספורות גם על מחשב אישי פשוט. המבנה מורכב משלושה שדות עיקריים בכל דגימה: dialog שמכיל רשימת מחרוזות של חלקי השיחה, act שכולל מערך מספרים המייצגים את כוונת המשפט, ו־emotion שכולל מערך מקביל של מספרי הרגש המשויכים לכל משפט.

from datasets import load_dataset

ds = load_dataset("li2017dailydialog/daily_dialog")

הרישיון

הרישיון הוא CC BY-NC-SA 4.0. המשמעות ברורה וחד משמעית: אסור לעשות בזה שימוש מסחרי מכל סוג שהוא. בנוסף, חובה לתת קרדיט ליוצרים, ואם אתם משנים את הנתונים או מפיצים גרסה מעובדת, אתם מחויבים להפיץ אותה תחת אותו רישיון בדיוק. אימון של מודל מסחרי על החומר הזה אינו מותר.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗