GPT
T

twitter-roberta-base-sentiment

קוד פתוח

cardiffnlpרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • roberta

זה מודל קלאסי לסיווג רגש בטוויטר שמחזיר חיובי, שלילי או ניטרלי. אם אתם צריכים לנתח ציוצים קצרים באנגלית בלי להסתבך עם פרומפטים, הוא נותן מענה מהיר וישיר.

  • 514טוקנים בהקשר
  • 1.4 GBמשקל הקבצים
  • 324,555הורדות בחודש
  • 338לייקים

מה זה

הבסיס כאן הוא RoBERTa עם 12 שכבות שאומן מראש על בערך 58 מיליון ציוצים באנגלית, ועבר כוונון ייעודי על בנצ'מרק TweetEval למשימת ניתוח רגש. הוא לוקח משפט ומוציא התפלגות הסתברויות על פני שלוש תוויות מוגדרות בלבד: שלילי, ניטרלי וחיובי.

בניגוד למודלי שפה כלליים שצריכים שתסבירו להם מה אתם רוצים, פה מדובר במקטלג טקסט ישיר. ההתאמה הספציפית לטוויטר גורמת לו להבין טוב יותר סלנג רשתי, קיצורים ומבנה טיפוסי של פוסטים ברשתות חברתיות בהשוואה למודל RoBERTa בסיסי שלא ראה שפת רחוב כזאת באימון שלו.

מתאים ל

  • ניתוח תגובות ברשתות

    מתאים למיון מהיר של ציוצים ופוסטים קצרים באנגלית לשלוש קטגוריות ברורות.

  • סינון פידבקים למוצר

    סיווג אוטומטי של ביקורות משתמשים קצרות באנגלית כדי לזהות תלונות דחופות.

  • מעקב אחר סנטימנט מותג

    עיבוד אלפי אזכורים ברשת במחיר אפסי בהרצה עצמית על מעבד רגיל.

איפה זה נופל

הוא מוגבל לטקסטים של עד 514 טוקנים ותומך באנגלית בלבד. אם תזרקו עליו עברית הוא פשוט לא יידע מה לעשות איתה, ובשביל שפות נוספות הכרטיס עצמו מפנה למודל הנפרד XLM-T. חוץ מזה, המודל פורסם במקור ב־2020 ומאגר האימון שלו ישן יחסית, כך שסלנג חדש מהשנים האחרונות עלול להתפספס אצלו לגמרי.

שאלות
נפוצות

האם המודל מבין עברית?

לא, המודל אומן על ציוצים באנגלית בלבד ולא יזהה עברית. היוצרים מפנים למודל אחר בשם XLM-T למי שמחפש תמיכה רב-לשונית.

כדאי להשתמש בו או בגרסה החדשה יותר?

היוצרים עצמם ממליצים על גרסת ה־latest, שאומנה על יותר דאטה ועל ציוצים עדכניים יותר. לרוב עדיף לבחור בה, אלא אם יש לכם צורך ספציפי לשחזר תוצאות ישנות של TweetEval.

איך מריצים

במשקל של 1.4 גיגה בייט, אתם יכולים להריץ אותו בקלות על כל מעבד מודרני בלי להזיע, ובטח שעל כרטיס מסך בסיסי עם מעט זיכרון. משיכת המשקולות דרך ספריית transformers היא עניין של כמה שורות קוד בודדות לסיווג רצף.

היוצרים עצמם מציינים שיש גרסה חדשה יותר בשם twitter-roberta-base-sentiment-latest שאומנה על כמות גדולה ועדכנית יותר של ציוצים. שווה להרים אותו בעצמכם אם אתם מעבדים נפחים גדולים של טקסטים קצרים ברצף, כי הרצה מקומית תהיה זולה ומהירה בהרבה מקריאות API חיצוניות.

from transformers import pipeline

pipe = pipeline("text-classification", model="cardiffnlp/twitter-roberta-base-sentiment")
print(pipe("שלום"))

הרישיון

היוצרים לא דיווחו על רישיון רשמי בדף המודל. מבחינה משפטית, היעדר רישיון מוגדר אומר שאין לכם הרשאה מפורשת להשתמש בו במוצר מסחרי, וזה יוצר סיכון משפטי ברור לחברות שרוצות להטמיע אותו בקוד שלהן.

הרישיון המלא בעמוד המודל ↗