GPT
T

tweet_sentiment_multilingual

קוד פתוח

cardiffnlpרישיון לא דווח2022-11-26

המאגר מציע ציוצים מתויגים לניתוח סנטימנט בשמונה שפות שונות במבנה אחיד. הוא מתאים למי שרוצה לבדוק מודלים רב לשוניים על טקסט קצר ויומיומי מרשתות חברתיות.

  • 3,223הורדות בחודש
  • 24לייקים

מה זה

הנתונים מגיעים מציוצים ברשת טוויטר ומיועדים לסיווג טקסט לשלושה רגשות בסיסיים. כל רשומה כוללת שני שדות בלבד, שדה הטקסט של הציוץ ושדה התווית המספרי שנע בין אפס עבור שלילי, אחד עבור ניטרלי ושתיים עבור חיובי. הטקסטים מכילים מאפיינים טיפוסיים לרשת כמו תיוגי משתמשים שהוחלפו במחרוזת ייעודית והאשטאגים.

האיסוף מחולק לשמונה שפות: אנגלית, ערבית, צרפתית, גרמנית, הינדי, איטלקית, פורטוגזית וספרדית. המבנה מאוזן לחלוטין בין השפות השונות, כאשר בכל שפה יש בדיוק 1,838 דוגמאות אימון, 323 דוגמאות ולידציה ו־869 דוגמאות מבחן, כך שסך הכל יש כ־24 אלף רשומות במאגר כולו.

הקבצים מסודרים בתיקיות נפרדות לכל שפה בפורמט שורות ג'ייסון. הכרטיס אינו מפרט את אופן הסינון של הציוצים או את זהות המתייגים האנושיים, אך מפנה למאמר המקורי של החוקרים שפורסם בכנס מדעי.

מתאים ל

  • בנצ'מרק למודל רב לשוני

    השוואת דיוק הסיווג של מודל יחיד על פני שמונה שפות שונות בתנאי גודל זהים.

  • ניתוח שיח ברשתות חברתיות

    אימון ראשוני של מסווג לזיהוי תגובות חיוביות או שליליות לציוצים באירופה ובאמריקה הלטינית.

  • בדיקת העברת ידע בין שפות

    בחינה של יכולת המודל ללמוד סנטימנט בשפה אחת ולהשליך אותו על שפה אחרת.

איפה זה נופל

עברית לא קיימת כאן, מה שהופך את המאגר ללא רלוונטי למוצרים שמכוונים ישירות לשוק המקומי בישראל. שנית, המאגר פורסם בסוף 2022 והציוצים עצמם נאספו קודם לכן, כך שסגנון הכתיבה והסלנג עשויים להיות מיושנים מעט. בנוסף, חלוקת האימון כוללת פחות מאלפיים דוגמאות לכל שפה, כמות קטנה יחסית שמתאימה בעיקר לבדיקת ביצועים ולא לאימון מודל תעשייתי מאפס.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא, המאגר תומך רק בשמונה שפות ספציפיות: אנגלית, ערבית, צרפתית, גרמנית, הינדי, איטלקית, פורטוגזית וספרדית. אין בו ייצוג לשפות שמיות מעבר לערבית.

האם מותר להשתמש בנתונים לצורך מסחרי?

הכרטיס מזכיר רישיון ייחוס חופשי, אך מחייב עמידה בתנאי השימוש של טוויטר שאוסרים לעיתים קרובות שימושים מסוימים בטקסטים שנאספו מהפלטפורמה. מאחר ובמטא-דאטה הרישיון מסומן כלא מדווח, לא הייתי בונה עליו מוצר מסחרי ללא ייעוץ משפטי.

כמה גדול הדאטהסט וכמה זמן לוקח להוריד אותו?

המאגר כולל סך הכל כ־24 אלף רשומות טקסט קצרות המחולקות לקובצי ג'ייסון. ההורדה והטעינה שלו לזיכרון נמשכות שניות ספורות ואינן דורשות משאבי אחסון מיוחדים.

איך טוענים

טוענים את המידע ישירות מספריית הדאטהסטים דרך הפורמט הסטנדרטי של שורות ג'ייסון, ללא צורך בהרשאה מיוחדת או אישור גישה מראש. המאגר קל משקל וכולל 27 קבצים בסך הכל. שדות המפתח הם הטקסט והתווית, כאשר יש לבחור את תת התיקייה לפי השפה הרצויה, והמידע מוכן לעבודה מול מודלים לסיווג משפטים.

from datasets import load_dataset

ds = load_dataset("cardiffnlp/tweet_sentiment_multilingual")

הרישיון

הכרטיס הרשמי מציין רישיון מסוג קריאייטיב קומונס 3.0 עם ייחוס, אך מזהיר במפורש שהשימוש כפוף לתנאי השירות ומדיניות ה־API של טוויטר. בשדה הרישיון המובנה לא דווח רישיון רשמי, מה שמייצר סיכון משפטי לא מבוטל. עבור מודל מסחרי חובה לבדוק היטב את תנאי השימוש בנתוני טוויטר לפני שמתחילים לאמן עליו.

הרישיון המלא ב־Hugging Face ↗