GPT
E

emotion-english-distilroberta-base

קוד פתוח

j-hartmannרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • roberta
  • text-classification

המודל מסווג טקסטים באנגלית לשבעה רגשות שונים לפי המודל של אקמן. הוא שוקל מעט יחסית ומתאים למי שרוצה ניתוח רגש ממוקד בלי להחזיק מודל ענק.

  • 514טוקנים בהקשר
  • 629 MBמשקל הקבצים
  • 517,641הורדות בחודש
  • 503לייקים

מה זה

הכלי מקבל טקסט באנגלית ומחזיר התפלגות הסתברויות על פני שבע קטגוריות, כעס, גועל, פחד, שמחה, עצב, הפתעה ומצב ניטרלי. הוא מבוסס על גרסה מכווצת של רוברטה עם שש שכבות, ואומן על שילוב של שישה מאגרי נתונים שונים שכוללים שיחות מטלוויזיה, פוסטים מטוויטר ורדיט ודיווחים עצמיים של סטודנטים.

במבחן התוצאה הוא מגיע לדיוק של 66 אחוזים על סט הבדיקה המאוזן שלו. בהתחשב בזה שניחוש אקראי בין שבע מחלקות נותן 14 אחוזים, מדובר בשיפור ברור, אבל הוא עדיין מפספס בשליש מהמקרים. הגודל הקומפקטי שלו נותן מענה מהיר כשצריך לרוץ על כמויות של טקסטים, כל עוד מבינים את מגבלת הדיוק.

מתאים ל

  • ניתוח תגובות ברשתות באנגלית

    הוא אומן על מידע מטוויטר ומרדיט, ולכן מכיר היטב סלנג וקיצורים שנפוצים בדיונים מקוונים.

  • סינון ומיון פניות תמיכה

    החלוקה לכעס או פחד עוזרת לתעדף פניות של לקוחות זועמים שדורשים מענה מהיר.

  • מחקר אקדמי על טקסטים

    מאפשר לעבור על ספריות טקסט גדולות בזול יחסית בזכות גודל קובץ צנוע של 629 מגה בייט.

איפה זה נופל

הדיוק עומד על 66 אחוזים בלבד, מה שאומר שאחת מכל שלוש תחזיות כנראה שגויה. הטקסטים ששימשו לאימון מגיעים ברובם מרשתות חברתיות כמו טוויטר ורדיט, ולכן הוא עלול להתקשות עם שפה מקצועית או משפטית. בנוסף, הוא עובד באנגלית בלבד ואינו מתאים לטקסטים בעברית.

שאלות
נפוצות

האם המודל תומך בטקסטים בעברית?

לא. הוא אומן אך ורק על מאגרי מידע באנגלית ויחזיר תוצאות חסרות משמעות על עברית. תצטרכו לתרגם את הטקסט קודם או להשתמש במודל רב לשוני.

כמה זיכרון דרוש כדי להריץ אותו בפרודקשן?

משקל הקבצים הוא 629 מגה בייט, כך שפחות מגיגה בייט אחד של זיכרון עבודה יספיק לטעינה. אפשר להריץ אותו בקלות על שרת בסיסי וזול בלי מעבד גרפי ייעודי.

מה ההבדל בינו לבין גרסת ה־RoBERTa-large?

גרסת ה־distil קטנה ומהירה יותר בזכות שש שכבות בלבד, על חשבון חלק מהדיוק. גרסת ה־large גדולה וכבדה יותר, ומתאימה למי שמוכן להשקיע יותר משאבי מחשוב עבור תוצאות מדויקות יותר.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות פונקציית pipeline רגילה למיון טקסט. עם משקל של 629 מגה בייט וחלון הקשר של 514 טוקנים, אין שום צורך בכרטיס מסך ייעודי כדי להריץ אותו, והוא יעבוד בלי בעיה גם על מעבד רגיל בשרת פשוט או במחשב מקומי.

מי שצריך דיוק גבוה יותר יכול לפנות לגרסת ה־RoBERTa-large של אותו יוצר, שהיא כבדה בהרבה. הרצה עצמית כאן זולה ופשוטה מאוד, ולכן אין סיבה לפנות ל־API חיצוני אלא אם כן אתם לא רוצים לנהל שרתים בכלל.

from transformers import pipeline

pipe = pipeline("text-classification", model="j-hartmann/emotion-english-distilroberta-base")
print(pipe("שלום"))

הרישיון

היוצר לא הגדיר רישיון שימוש בקבצי המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בו במוצר מסחרי, וזה יוצר סיכון לחברות שרוצות להטמיע אותו בקוד שלהן.

הרישיון המלא בעמוד המודל ↗