GPT
G

go_emotions

קוד פתוח

google-research-datasetsapache-2.02022-03-02

  • emotion

תגובות מרדיט שמתוייגות לפי עשרים ושבעה רגשות שונים בנוסף לנייטרלי. זה הבסיס שצריך כשסנטימנט בינארי של חיובי או שלילי פשוט לא מספיק למודל שלכם.

  • 9,510הורדות בחודש
  • 267לייקים

מה זה

המאגר מכיל תגובות טקסט של משתמשי רדיט דוברי אנגלית, שנאספו בשיטות אוטומטיות. כל רשומה מייצגת תגובה בודדת שסווגה לקטגוריות רגש מפורטות כמו שמחה, הערצה, כעס, או נייטרליות. המטרה של איסוף כזה היא לאפשר הבנה עדינה של שיח אנושי ברשת, במקום להסתפק בחלוקה גסה של סנטימנט חיובי מול שלילי.

יש כאן שתי תצורות עבודה בקובצי פרקט. הגרסה הפשוטה מחלקת את המידע לשלושה חלקים מוכנים של אימון עם 43,410 רשומות, אימות עם 5,426 רשומות, ובדיקה עם 5,427 רשומות. בגרסה הזו מקבלים את מזהה התגובה, הטקסט, ורשימת מזהי רגשות לתיוג רב־מחלקתי. הגרסה הגולמית מציגה כל רגש בעמודה בינארית נפרדת עם אפס או אחד, ומוסיפה מטא־דאטה רחב על כל תגובה.

מתאים ל

  • סיווג רגשות מרובה

    אימון מודלים שמזהים קשת רחבה של 27 רגשות בטקסט קצר ולא רק סנטימנט בסיסי.

  • ניתוח שיח ברשתות

    זיהוי תגובות של כעס, עצב או אהדה במערכות ניטור קהילה ותוכן מקוון.

  • בוטים עם אמפתיה

    התאמת תגובות של סוכני שיחה על פי מצבו הרגשי של המשתמש.

איפה זה נופל

הנתונים מגיעים ממשתמשי רדיט בלבד ובשפה האנגלית, מה שמביא איתו את הסלנג, הדמוגרפיה וההטיות של הפלטפורמה הזו. עברית לא קיימת כאן בכלל. כל עבודת התיוג נעשתה על ידי שלושה עובדים דוברי אנגלית מהודו, עובדה שהחוקרים מציינים כגורם שמשפיע על הדיוק, התפיסה התרבותית של רגשות והתיוג בפועל. בנוסף, סינון הטקסטים התבסס על רשימות מילים פוגעניות וגסות, מה שעלול ליצור עיוותים בזיהוי זהויות. בעיה נוספת היא פרטיות, שכן שמות המשתמשים המקוריים מופיעים בנתונים הגולמיים ועלולים לחשוף את זהות הכותבים.

שאלות
נפוצות

האם מותר להשתמש בזה במוצר מסחרי?

כן. הרישיון הוא אפאצ'י 2.0, שמאפשר שימוש מסחרי חופשי באימון מודלים ופיתוח מערכות. הדרישה העיקרית היא לשמור על תנאי הרישיון ומתן ייחוס למחברים המקוריים.

האם יש בדאטהסט תמיכה בעברית?

לא. כל הטקסטים נאספו מתגובות באנגלית ברדיט. כדי להשתמש ביכולות האלה בעברית תצטרכו לתרגם את המאגר או להשתמש בו לאימון מודל רב־לשוני.

במה הוא שונה ממאגרי סנטימנט רגילים?

רוב מאגרי הסנטימנט מספקים חלוקה שטחית לחיובי, שלילי או נייטרלי. כאן יש פירוק ל־27 קטגוריות רגש שונות כמו גאווה, פחד, הקלה והכרת תודה, עם אפשרות לתיוג של כמה רגשות במקביל לאותו משפט.

מאיפה הגיע המידע ומי תייג אותו?

הטקסטים נלקחו מתגובות ציבוריות ברדיט. התיוג נעשה על ידי שלושה עובדים דוברי אנגלית מהודו שסיווגו את הרגשות בכל תגובה, ויש לקחת בחשבון את ההקשר התרבותי של התיוגים האלה.

איך טוענים

טוענים את המידע ישירות בקבצי פרקט דרך ספריית הדאטהסטים הרגילה, בלי שום צורך לבקש אישור גישה מוקדם או להמתין למפתח. המאגר מכיל שישה קבצים בלבד כך שההורדה מהירה מאוד. כשניגשים לעבודה, צריך לבחור בין התצורה הפשוטה שמספקת עמודת תוויות מוכנה, לבין התצורה הגולמית שכוללת שדות נוספים כמו שם המשתמש ברדיט, הסאברדיט, מזהה המתייג, חותמת זמן, וסימון למקרים שבהם התוכן היה לא ברור למתייגים.

from datasets import load_dataset

ds = load_dataset("google-research-datasets/go_emotions")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והנתונים, והפצה מחדש, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף את הפיתוחים שלכם תחת אותו הרישיון, ואפשר לאמן עליו מודלים מסחריים בלי לחשוף את הקוד הפנימי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗