GPT
T

twitter-xlm-roberta-base-sentiment-finetunned

קוד פתוח

citizenlabרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • xlm-roberta
  • text-classification
  • en

סיווג סנטימנט רב-לשוני מבוסס טוויטר שרץ מקומית בקלות. מתאים למי שצריך תיוג חיובי, שלילי או ניטרלי בשמונה שפות אירופיות בלי לשלוח מידע החוצה.

  • 514טוקנים בהקשר
  • 1.0 GBמשקל הקבצים
  • 18,223הורדות בחודש
  • 42לייקים

מה זה

מדובר בהתאמה של XLM-RoBERTa base שמבוססת על העבודה של Cardiff NLP לסנטימנט בטוויטר. הוא מאומן לזהות שלושה מצבים, חיובי, שלילי וניטרלי, בטקסטים קצרים בשמונה שפות: אנגלית, הולנדית, צרפתית, פורטוגזית, איטלקית, ספרדית, גרמנית ודנית. עברית אין כאן.

תוצאות המדידה בכרטיס חושפות בעיה קשה. ה־recall על טקסט שלילי עומד על 0.14 בלבד עם f1 של 0.23, מתוך מדגם זעיר של 28 מופעים. זה אומר שהוא מפספס כמעט את כל ההודעות השליליות ונוטה לדחוף אותן לקטגוריה הניטרלית, שקיבלה recall של 0.94. הוא עובד יפה בזיהוי פוזיטיבי, אבל עיוור כמעט לחלוטין לתוכן שלילי.

מתאים ל

  • סינון שבחים בפידבקים

    זיהוי תגובות חיוביות בשפות אירופיות, שם יש לו דיוק של 0.89 ומדד f1 של 0.85.

  • ניתוח ציוצים רב-לשוני

    מיון ראשוני של טקסטים קצרים בשמונה שפות נתמכות ישירות על השרת שלכם.

  • סיווג ראשוני של תוכן ניטרלי

    הפרדת שיח אינפורמטיבי יבש, תחום שבו המודל מציג תפיסה של 94 אחוזים.

איפה זה נופל

הנתונים בדף מראים בבירור שהוא כושל בזיהוי תוכן שלילי, עם דיוק תפיסה של 14 אחוז בלבד. בנוסף, המבחן כולו נערך על 211 דוגמאות בלבד, שזה מדגם קטן מכדי להסיק ממנו מסקנות יציבות לפרודקשן. חלון ההקשר מוגבל ל־514 טוקנים ומתאים לפורמט של פוסטים וציוצים, לא למסמכים ארוכים.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן והוגדר עבור שמונה שפות בלבד, שכולן אירופיות: אנגלית, הולנדית, צרפתית, פורטוגזית, איטלקית, ספרדית, גרמנית ודנית. טקסט בעברית יקבל תוצאות חסרות משמעות.

האם כדאי להשתמש בו לזיהוי לקוחות כועסים?

ממש לא. על פי הבדיקות שפורסמו, המודל מזהה רק 14 אחוז מהטקסטים השליליים ומסווג את הרוב כניטרלי. במערכת שירות לקוחות הוא פשוט יפספס כמעט כל תלונה.

כמה זיכרון צריך כדי להריץ אותו?

המשקל הכולל של הקבצים הוא 1.0GB בפורמט float32. כל שרת בסיסי או מחשב פיתוח עם 2GB עד 4GB זיכרון פנוי יריץ אותו בקלות על ה־CPU.

איך מריצים

המודל שוקל 1.0GB ונשען על transformers ישירות דרך pipeline של text-classification. בגלל הגודל הצנוע ו־12 השכבות שלו, כל מעבד סביר יריץ אותו בזמן תגובה טוב, ואין שום צורך בכרטיס מסך ייעודי אם אתם לא מעבדים מיליוני שורות ברגע.

משתמשים בו מקומית פשוט כדי לא לשלם על API חיצוני כשמנתחים כמויות של פידבקים קצרים, אבל אם אתם צריכים אמינות בזיהוי תלונות או רטוריקה עוינת, API מסחרי ייתן תוצאות מדויקות בהרבה בלי הפספוסים שיש כאן בשלילי.

from transformers import pipeline

pipe = pipeline("text-classification", model="citizenlab/twitter-xlm-roberta-base-sentiment-finetunned")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

ליוצר אין הצהרת רישיון בדף המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בו, להפיץ אותו או לשלב אותו במוצר מסחרי. כל שימוש כזה כרגע הוא סיכון שתצטרכו להחליט אם לקחת.

הרישיון המלא בעמוד המודל ↗