GPT
E

emotion_text_classifier

קוד פתוח

michelleli99רישיון לא דווח2022-10-22

  • transformers
  • pytorch
  • roberta
  • text-classification
  • distilroberta

סיווג רגשות בטקסט אנגלי שמבוסס על דיסטילציה ומכוון לדיאלוגים מדוברים. הוא שוקל מעט מאוד ומתאים למי שמחפש מיפוי מהיר לשבעה רגשות בסיסיים בלי להחזיק שרת כבד.

  • 514טוקנים בהקשר
  • 317 MBמשקל הקבצים
  • 54,801הורדות בחודש
  • 151לייקים

מה זה

מדובר בהתאמה של DistilRoBERTa לתיוג רגשות לפי שש הקטגוריות של אקמן בתוספת מצב ניטרלי: כעס, גועל, פחד, שמחה, עצב, הפתעה וניטרליות. הבסיס שעליו הוא נשען כבר אומן על שורה של מאגרי רגשות מוכרים באנגלית, כמו GoEmotions ו־MELD, אבל היוצרת ביצעה עליו אימון נוסף ספציפית על תמלילים של הסדרה חברים מתוך מאגר EmotionLines.

המשמעות של הכוונון הזה היא התאמה לדיאלוגים קצרים, יומיומיים וטלוויזיוניים, להבדיל מסתם פוסטים ברשת או ביקורות מוצר. אין פה ארכיטקטורה חדשה אלא מודל קל עם שש שכבות שלוקח בסיס קיים ודוחף אותו עוד צעד לכיוון של שיחה מדוברת. כרטיס המודל לא מציג מדדי ביצועים או השוואה מול גרסת המקור, כך שאין דרך לדעת מהמספרים אם האימון הנוסף פגע ביכולות הכלליות או שיפר אותן.

מתאים ל

  • סיווג דיאלוגים בתסריטים

    הוא אומן על תמלילי שיחה, ולכן מתאים לפילוח רגשי של דיאלוגים מתוך תוכניות וסרטים באנגלית.

  • ניתוח צ'אטים באנגלית

    המשקל הנמוך והאופי השיחתי עוזרים לזהות תסכול או שביעות רצון של לקוחות בזמן אמת בלי שרת כבד.

  • סינון ראשוני למאגרי טקסט

    בזכות המהירות שלו על מעבד רגיל, אפשר לתייג כמויות של משפטים לשבע קטגוריות בלי עלויות API.

איפה זה נופל

האימון הסופי נשען על תמלילים של קומדיית מצבים משנות התשעים. בגלל זה, סרקאזם, שפה מקצועית, שפת רחוב עכשווית או טקסטים טכניים עלולים לבלבל אותו לחלוטין. הוא תומך באנגלית בלבד, כך שבעברית אין מה לנסות להריץ אותו בלי תרגום מקדים.

בעיה נוספת היא חוסר מוחלט בציוני דיוק או בדיקות איכות בכרטיס המודל. לא מדווח כמה הוא מדויק בכל רגש, מה שיעור הטעויות שלו בין כעס לגועל, או איך הוא מגיב למשפטים מורכבים עם רגשות מעורבים. לפני שמכניסים אותו לפרודקשן, חובה לבחון אותו על דאטה אמיתי מהמערכת שלכם.

שאלות
נפוצות

האם הוא מתאים לניתוח שיחות שירות לקוחות?

הוא יכול לעבוד על משפטים פשוטים וקצרים באנגלית, אבל קחו בחשבון שהוא אומן על תסריטי טלוויזיה. ניואנסים עסקיים או כעס פסיבי-אגרסיבי של לקוח לא בהכרח יזוהו באותה צורה כמו שורות מחברים.

אפשר להשתמש בו בתוך פרויקט מסחרי של החברה?

לא מומלץ בלי בירור מראש. בדף המודל אין רישיון מוצהר, ולכן אין היתר שימוש מפורש. אם אתם בונים מוצר לחברה, פנו למפרסמת במייל או חפשו מודל חלופי שמגיע עם רישיון אפאצ'י או MIT.

איך מריצים

המשקל הכולל עומד על 317 מגה-בייט, מה שאומר שאין שום סיבה לחפש מעבד גרפי ייעודי בשבילו. אפשר להריץ אותו ישירות על מעבד רגיל בכל לפטופ או שרת בסיסי, כשהוא נטען בשורה אחת עם הפייפליין של transformers ומחזיר תוצאות כמעט מיד.

בגלל המשקל הזעיר וצריכת המשאבים הנמוכה, אין שום היגיון לשלם ל־API חיצוני על קריאות לסיווג רגשות מהסוג הזה. מרימים אותו לוקאלית כחלק מהקוד שלכם, חוסכים עלויות רשת וחיובים לפי קריאה, ומקבלים שליטה מלאה על התהליך.

from transformers import pipeline

pipe = pipeline("text-classification", model="michelleli99/emotion_text_classifier")
print(pipe("שלום"))

הרישיון

היוצרת לא הגדירה רישיון למודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם אישור רשמי להשתמש בקבצים, להפיץ אותם או לשלב אותם במוצר מסחרי. כדי למנוע חשיפה לתביעות, מפתחים שצריכים כלי לפרודקשן עסקי יצטרכו לפנות ישירות למייל של המפרסמת או לבחור מודל עם רישיון פתוח ברור.

הרישיון המלא בעמוד המודל ↗