GPT
E

emotion

קוד פתוח

dair-aiother2022-03-02

  • emotion-classification

ציוצים באנגלית שמתוייגים לפי שש רגשות בסיסיים. מאגר קל ונוח למי שרוצה לאמן או לבדוק מודל סיווג טקסט בלי להסתבך עם קבצים ענקיים.

  • 21,097הורדות בחודש
  • 457לייקים

מה זה

המאגר מורכב ממשפטים קצרים ואישיים שמקורם בטוויטר, כשכל שורה מכילה שני שדות בלבד: מחרוזת טקסט ותגית מספרית של רגש מתוך שש אפשרויות, כולל עצב, שמחה, אהבה, כעס, פחד והפתעה. הכרטיס לא מפרט איך המידע נאסף, האם סינון כלשהו הופעל על הציוצים, או מי בדיוק ביצע את התיוג בפועל.

הנתונים מחולקים לשתי גרסאות עבודה. הראשונה היא גרסה מחולקת של עשרים אלף דוגמאות שכוללת 16,000 רשומות לאימון, 2,000 לאימות ועוד 2,000 למבחן. השנייה היא גרסה לא מחולקת שמכילה 416,809 רשומות בקובץ אימון בודד.

מתאים ל

  • אימון מודל סיווג רגשות

    בניית מודל לזיהוי שש רגשות בסיסיים בטקסט חופשי באנגלית.

  • הערכת ביצועי מודלי שפה

    הרצת בדיקות השוואה של דיוק מודלים על חלוקת המבחן המוכנה.

  • תרגול ומחקר אקדמי

    שימוש בקבצים הקלים לפרויקטים לימודיים בתחום עיבוד שפה טבעית.

איפה זה נופל

הכרטיס משאיר כמעט את כל סעיפי התיעוד ריקים, כך שאין שום מידע על הטיות תרבותיות, זהות הכותבים, או נוכחות של פרטים מזהים בטקסט. הדאטהסט כולו באנגלית בלבד ואין בו שום ייצוג לעברית. בנוסף, מדובר בציוצים ישנים מרשתות חברתיות שמתאפיינים בסלנג, קיצורים ושגיאות כתיב, ולא בטקסט מקצועי או פורמלי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא, הרישיון אוסר על כך במפורש. הכרטיס קובע שהשימוש מיועד למטרות חינוכיות ומחקריות בלבד. אם המטרה היא להטמיע את המודל בתוך מוצר מסחרי, תצטרכו לחפש מקור נתונים אחר עם רישיון פתוח.

האם יש במאגר תמיכה בטקסט בעברית?

אין במאגר עברית בכלל. כל הנתונים מבוססים על ציוצים באנגלית שנאספו מטוויטר. כדי לסווג רגשות בעברית תצטרכו לתרגם את החומר או להשתמש במאגר מקומי נפרד.

כמה מקום ומשאבים נדרשים כדי להריץ אותו?

המאגר קטן מאוד ונוח לעבודה מקומית. קובצי ההורדה שוקלים 16.13 מגה בייט, ובסך הכל הוא תופס 63.75 מגה בייט על הדיסק. אפשר לטעון ולעבד אותו במהירות גם על מחשב נייד רגיל בלי חומרה חזקה.

מאיפה הגיעו הנתונים ומי תייג אותם?

הכרטיס מציין שהמקור הוא הודעות טוויטר, אך משאיר את שאר הפרטים ריקים. לא מצוין בו איך דגמו את הציוצים, מי היו המתייגים, או האם נעשתה בקרת איכות על התוויות. לפרטים נוספים המפרסמים מפנים למאמר המקורי דרך הגיטהאב שלהם.

איך טוענים

טוענים אותו ישירות דרך ספריית הדאטהסטים הרגילה לפי המזהה dair-ai/emotion. ההורדה שוקלת 16.13 מגה בייט בלבד, והקבצים שמורים בפורמט פרקט, כך שכל העסק תופס סך הכל כשישים וארבעה מגה בייט על הדיסק. אין צורך באישור גישה או הרשמה מיוחדת. בתוך המבנה צריך לשים לב לשדה text ולשדה label שנע בין 0 ל־5.

from datasets import load_dataset

ds = load_dataset("dair-ai/emotion")

הרישיון

הרישיון מוגדר תחת סעיף אחר ומגביל את השימוש לצורכי מחקר וחינוך בלבד. אין אישור לשימוש מסחרי, ולכן אי אפשר לשלב אותו במוצר עסקי פעיל או למכור מודל שאומן על בסיס הנתונים האלה.

הרישיון המלא ב־Hugging Face ↗