GPT
S

sentiment-roberta-large-english

קוד פתוח

siebertרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • roberta

מודל לסיווג סנטימנט באנגלית שאומן על 15 מאגרי מידע במקביל. הוא מתאים למי שצריך דיוק גבוה על סוגי טקסט שונים, ולא רק על ביקורות סרטים.

  • 514טוקנים בהקשר
  • 4.0 GBמשקל הקבצים
  • 58,261הורדות בחודש
  • 159לייקים

מה זה

מדובר בהתאמה של RoBERTa-large לניתוח סנטימנט בינארי, חיובי או שלילי בלבד, בשפה האנגלית. רוב המודלים הקטנים שתמצאו במאגרים אומנו על סט נתונים בודד, בדרך כלל SST-2, ולכן הם נוטים להתרסק כשהם פוגשים טקסטים קצרים מטוויטר או כותרות של מוצרים.

כאן לקחו גישה רחבה יותר ואימנו אותו על 15 מקורות שונים, מביקורות מוצרים של אמזון ועד ציוצים. לפי נתוני הבדיקה, המודל מגיע לדיוק ממוצע של 93.2 אחוזים, לעומת 78.1 אחוזים של DistilBERT שמכוון רק ל־SST-2. ההבדל בולט במיוחד בטקסטים קצרים ומבולגנים כמו כותרות ביקורת, שם הוא שומר על פער של יותר מעשרים אחוז.

מתאים ל

  • סיווג ביקורות מוצר

    הוא אומן על מגוון סקירות מוצרים ומזהה היטב שביעות רצון גם בכותרות קצרות.

  • ניתוח פידבקים ברשתות

    המודל נבדק על ציוצים ומציג עמידות גבוהה יותר לסלנג בהשוואה למודלים בסיסיים.

  • בסיס לאימון נוסף

    אפשר להשתמש במשקלים שלו כנקודת מוצא טובה יותר להתאמה על נתונים פנימיים באנגלית.

איפה זה נופל

הפלט הוא בינארי בלבד, כלומר 0 לשלילי ו־1 לחיובי. אין פה מצב ניטרלי, כך שאם תזינו טקסט עובדתי, שאלות או תוכן אדיש, המודל ייאלץ לבחור צד בכוח ולטעות.

בנוסף, חלון ההקשר מוגבל ל־514 טוקנים והוא מבין אנגלית בלבד. אם יש לכם טקסטים בעברית או מסמכים ארוכים, הוא לא יתאים בלי פיצול אגרסיבי של הטקסט לפני השליחה.

שאלות
נפוצות

האם המודל יודע להתמודד עם עברית?

לא. המודל אומן אך ורק על טקסטים באנגלית. הוא לא תומך בעברית ואי אפשר להשתמש בו לניתוח שפה מקומית.

מה קורה כשהטקסט שנבדק הוא ניטרלי?

הוא יחזיר תוצאה שגויה. הארכיטקטורה מכוונת להוציא רק אפס או אחת, ולכן הוא ידביק תווית חיובית או שלילית גם למשפטים חסרי רגש.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־4.0 גיגה-בייט, עם 24 שכבות של ארכיטקטורת large. בשביל להריץ אותו מקומית בקצב סביר תצטרכו כרטיס מסך ייעודי, כי על מעבד רגיל זמני התגובה לכל משפט יהיו ארוכים מדי לשימוש שדורש מהירות.

אפשר לטעון אותו ישירות דרך הספרייה transformers בשתי שורות קוד לתוך pipeline של סיווג טקסט. אם אין לכם שרת עם מעבד גרפי זמין ורציף, או שאתם רק בודקים את הביצועים על קובץ נתונים, עדיף להריץ את מחברת הגוגל קולאב שהיוצרים סיפקו במקום להקים שרת עצמאי.

from transformers import pipeline

pipe = pipeline("text-classification", model="siebert/sentiment-roberta-large-english")
print(pipe("שלום"))

הרישיון

בעמוד המודל לא דווח רישיון כלל. מבחינה משפטית, היעדר רישיון מוגדר אומר שאין לכם הרשאה מפורשת להשתמש במשקלים שלו במוצר מסחרי, וחברות עם בדיקות תאימות קפדניות לא יאשרו להכניס אותו לסביבת ייצור.

הרישיון המלא בעמוד המודל ↗