GPT
T

tweet_eval

קוד פתוח

cardiffnlpunknown2022-03-02

ריכוז של שבע משימות סיווג שונות לטוויטר במבנה אחיד עם חלוקה קבועה. הוא חוסך את הצורך לאסוף ולנקות בנפרד מבחני ביצועים ישנים לניתוח טקסט ברשתות חברתיות.

  • 20,977הורדות בחודש
  • 149לייקים

מה זה

המאגר מאגד שבע משימות שונות של סיווג טקסט שנאספו מטוויטר ומחולקות לתצורות נפרדות. המשימות כוללות זיהוי אירוניה, דברי שטנה, שפה פוגענית, עמדה כלפי נושאים מוגדרים, חיזוי אימוג'י, רגשות וניתוח סנטימנט. בכל רשומה יש שני שדות בלבד: מחרוזת הטקסט של הציוץ ומספר שמייצג את התווית לפי המשימה הרלוונטית. הציוצים כוללים תיוגים פנימיים כמו user במקום שמות משתמשים.

המקורות מגיעים מתחרויות SemEval שונות שנערכו בין השנים 2016 ל־2019. המפרסמים ארגנו מחדש את המידע לתוך פורמט תואם שכולל פיצול קבוע לאימון, בדיקה ואימות עבור כל תצורה. במשימת עמדה, הנתונים מחולקים לתתי נושאים מוגדרים כמו הפלות, אתאיזם, שינוי אקלים, פמיניזם והילרי קלינטון. גודל הפיצולים משתנה בצורה קיצונית בין המשימות, החל ממאות בודדות של רשומות בחלק מנושאי העמדה ועד לעשרות אלפי רשומות בסנטימנט ובאימוג'י.

מתאים ל

  • השוואת מודלים על סנטימנט

    מדידת ביצועים של מסווגי טקסט על שפה בלתי פורמלית באנגלית באמצעות הפיצול הקבוע.

  • אימון זיהוי תוכן פוגעני

    כוונון מודלים לזיהוי שפה פוגענית ברשתות חברתיות על בסיס משימת offensive.

  • מחקר על חיזוי רגשות וסרקזם

    בדיקת יכולת המודל לתפוס ניואנסים של אירוניה ואימוג'י בטקסטים קצרים.

איפה זה נופל

הטקסטים כולם באנגלית ומבוססים על שיח טוויטר היסטורי, בעיקר מהשנים 2016 עד 2019. הכרטיס לא מספק פרטים על הטיות, אופן הסינון הראשוני או הדמוגרפיה של הכותבים והמתייגים, והשאיר סעיפים אלה ריקים. המשמעות היא שאתם מקבלים שפה סלנגית וקיצורים ספציפיים לתקופה ההיא, ללא מידע על רמת ההסכמה בין המתייגים. בנוסף, משימות מסוימות כמו זיהוי עמדות מכילות מאות בודדות של דוגמאות אימון, כמות קטנה מאוד למודלים מודרניים. הדאטהסט לא כולל עברית כלל ולא מתאים להערכת מודלים מקומיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הכללי אינו מוגדר ורובו המוחלט מורכב מתתי מאגרים ללא רישיון ברור או עם דרישה לקבלת אישור ייעודי כמו במשימת דברי השטנה. בנוסף, הנתונים הם ציוצים הכפופים למדיניות של טוויטר. לא הייתי בונה על זה מוצר מסחרי בלי בדיקה משפטית של כל משימה בנפרד.

האם יש במאגר נתונים בעברית?

לא. כל הנתונים נאספו באנגלית בלבד ומשקפים את סגנון הכתיבה של משתמשי טוויטר בשפה הזו. למחקר או פיתוח בעברית המאגר הזה אינו רלוונטי.

איך הנתונים נאספו ותויגו?

כרטיס המאגר לא מספק מידע על תהליך האיסוף, הסינון או הפרופיל של המתייגים, והסעיפים האלה מופיעים בו כחסרים. הנתונים אוחדו ממספר תחרויות SemEval שפורסמו בין 2016 ל־2019, כך שכל משימה נאספה במקור בפרויקט נפרד לפי שיטות שלא פורטו כאן.

מה ההבדל בין המאגר הזה לטעינת המשימות המקוריות?

היתרון כאן הוא האחדה טכנית. במקום לחפש ולהמיר כל מאגר של SemEval בנפרד, קיבלתם פורמט זהה של שדות טקסט ותווית מספרית, יחד עם חלוקה קבועה מראש של סטים לאימון ובדיקה שמקלה על השוואת ביצועים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון שם המאגר והקונפיגורציה הספציפית שרוצים לבדוק, למשל sentiment או hate. הקבצים שמורים בפורמט Parquet בחלוקה לפי תיקיות של המשימות, ואין צורך באישור גישה מוקדם ב־Hugging Face כדי למשוך אותם. בכל תצורה שתטענו תקבלו את השדות text ו־label, כאשר ה־label הוא מזהה מספרי שדורש מיפוי מול התיעוד כדי להבין איזו מחלקה הוא מייצג.

from datasets import load_dataset

ds = load_dataset("cardiffnlp/tweet_eval")

הרישיון

הרישיון הכללי מסומן כלא ידוע, מכיוון שהמאגר הוא אוסף של מקורות שונים ולכל חלק יש תנאים משלו. משימת הסנטימנט פורסמה תחת רישיון ייחוס Creative Commons Attribution 3.0, משימת דברי השטנה דורשת בקשת רשות מקורית, ובשאר התצורות הרישיון אינו מוגדר. בנוסף, כל שימוש כפוף לתנאי השימוש של טוויטר. אי אפשר להניח שמותר להשתמש בזה למטרות מסחריות או לאמן על זה מודל מסחרי בלי להסדיר זכויות מול בעלי המקור של כל תת מאגר.

הרישיון המלא ב־Hugging Face ↗