GPT
B

bert-base-uncased-emotion

קוד פתוח

bhadresh-savaniapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

סיווג רגשות בטקסט אנגלי שמחזיר חלוקה לשישה רגשות מוגדרים. הוא מיועד למי שצריך תיוג מדויק של סנטימנט מורכב בלי להרים מודל שפה ענק.

  • 109Mפרמטרים
  • 512טוקנים בהקשר
  • 1.6 GBמשקל הקבצים
  • 7,982הורדות בחודש

מה זה

מדובר בהתאמה של BERT קלאסי למשימת זיהוי רגשות מתוך טקסט, שאומן ספציפית על מאגר של ציוצי טוויטר. הפלט שלו מפרק כל משפט להסתברות מול שש תוויות: עצב, שמחה, אהבה, כעס, פחד והפתעה, במקום סתם לחלק לחיובי ושלילי.

במבחני הביצועים הוא מגיע לדיוק של 94.05 אחוז וציון F1 כמעט זהה, שזה מעט מעל חלופות כמו RoBERTa או ALBERT באותו גודל. מצד שני, ההבדל בינו לבין גרסת DistilBERT זניח לחלוטין ברמת הדיוק, אבל הגרסה הזו מעבדת רק 190 דגימות בשנייה לעומת כמעט 400 בגרסה המוקטנת. אם כל אלפית שנייה קריטית לכם, התוספת השולית בדיוק כנראה לא מצדיקה את הירידה בקצב.

מתאים ל

  • ניתוח תגובות משתמשים

    זיהוי כעס או תסכול בהודעות תמיכה קצרות באנגלית כדי לנתב פניות דחופות לנציגים אנושיים.

  • ניטור שיח ברשתות

    סריקת פוסטים וציוצים באנגלית בזמן אמת ומעקב אחרי תנודות של שמחה או פחד סביב מותג.

  • תיוג רגשי לסקרים

    חלוקה מהירה של תשובות פתוחות בסקרים לשישה רגשות מוגדרים בלי תיוג ידני יקר.

איפה זה נופל

האימון נעשה על טוויטר באנגלית בלבד. זה אומר שהוא מתקשה עם טקסטים ארוכים, מסמכים רשמיים, שפה טכנית או סלנג שלא מופיע ברשתות חברתיות. בעברית הוא פשוט לא יעבוד. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים, כך שאי אפשר לזרוק עליו פסקאות שלמות ולצפות לתשובה אמינה בלי לחתוך אותן קודם.

שאלות
נפוצות

האם המודל תומך בטקסטים בעברית?

לא. המודל מתבסס על bert-base-uncased ואומן על דאטה באנגלית בלבד. הרצה של עברית תניב תוצאות שגויות או חסרות משמעות לחלוטין.

האם כדאי להעדיף אותו על פני DistilBERT?

לרוב לא. השיפור בדיוק עומד על כרבע אחוז בלבד, אבל הוא מעבד חצי מכמות הטקסט בשנייה ושוקל כמעט כפול בזיכרון.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון עם pipeline לסיווג טקסט. עם משקל של 1.6 גיגה בייט וסביב 109 מיליון פרמטרים, אפשר להריץ אותו בקלות על כל מעבד מודרני בלי לחובה להחזיק כרטיס מסך ייעודי בסביבת הייצור.

שרת עצמאי פשוט יספיק פה לגמרי, ואין סיבה אמיתית לשלם על API חיצוני כשמדובר בגודל כזה. שווה להשתמש בממשק חיצוני רק אם אתם בודקים היתכנות של כמה ימים ולא רוצים לגעת בתשתיות בכלל.

from transformers import pipeline

pipe = pipeline("text-classification", model="bhadresh-savani/bert-base-uncased-emotion")
print(pipe("שלום"))

הרישיון

רישיון Apache 2.0 פתוח ומאפשר שימוש מסחרי מלא, כולל שינוי הקוד והפצה פנימית או חיצונית במוצר שלכם. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים המקורית והצהרה על שינויים אם נעשו כאלה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗