GPT
T

t5-base-finetuned-emotion

קוד פתוח

mrm8488רישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • jax
  • t5
  • text2text-generation

גרסה מכווננת של T5 שמזהה שש רגשות בסיסיים בטקסט אנגלי. פתרון קל וישיר אם צריך קלסיפיקציה מהירה בלי להקים תשתית ענקית מסביב.

  • 512טוקנים בהקשר
  • 1.7 GBמשקל הקבצים
  • 5,811הורדות בחודש
  • 56לייקים

מה זה

מנוע ה־T5 הבסיסי של גוגל עבר כאן כיוונון ייעודי למשימה בודדת: זיהוי רגשות מתוך טקסט. במקום סיווג בינארי של חיובי או שלילי, הוא מחזיר אחת משש תוויות מוגדרות: עצב, שמחה, אהבה, כעס, פחד או הפתעה. הוא עובד במתכונת של טקסט לטקסט, כך שהוא פשוט מייצר את שם הרגש כפלט ישיר.

במבחני הביצועים על סט של 2,000 דגימות הוא מגיע לדיוק כולל של 93 אחוז, אבל יש הבדלים ברורים בין הקטגוריות. בזיהוי עצב ושמחה הוא מדויק מאוד עם ציון F1 של 0.97 ו־0.95, כנראה בגלל ייצוג גבוה בדאטה. לעומת זאת, ברגשות מורכבים יותר עם פחות דוגמאות כמו הפתעה, רמת הדיוק צונחת ל־0.73, מה שאומר שהוא יטה לתייג דברים כהפתעה גם כשהם לא.

מתאים ל

  • ניתוח משובי לקוחות באנגלית

    זיהוי מהיר של כעס או עצב בפניות תמיכה קצרות כדי לתעדף טיפול בלקוחות לא מרוצים.

  • סינון תגובות ברשתות

    מעקב אחר תגובות קצרות וציוצים באנגלית לזיהוי אווירה כללית של שמחה או פחד.

  • תיוג תוכן במערכות CRM

    הוספת תווית רגשית פשוטה להיסטוריית שיחות והודעות טקסט של משתמשים.

איפה זה נופל

הוא מוגבל לחלוטין לטקסטים באנגלית, כך שעבור תוכן בעברית הוא פשוט לא רלוונטי. חלון ההקשר מוגבל ל־512 טוקנים, מה שמתאים לציוצים, הודעות או פסקאות קצרות, אבל לא יספיק למסמכים ארוכים.

הבעיה העיקרית היא חוסר האיזון בביצועים. התוצאות מראות שהוא מתקשה במיוחד עם הפתעה ואהבה, שם יש לו נטייה לפספס או לייצר זיהויים שגויים ביחס לקטגוריות החזקות כמו שמחה ועצב.

שאלות
נפוצות

האם אפשר להשתמש בו לניתוח טקסטים בעברית?

לא. הוא אומן על דאטה באנגלית בלבד והוא לא יודע להתמודד עם שפות אחרות. אם תזינו לו עברית, תקבלו פלטים שגויים או חסרי משמעות.

האם הוא מתאים לניתוח מאמרים ארוכים?

ממש לא. חלון ההקשר שלו מוגבל ל־512 טוקנים בלבד. הוא מתאים למשפטים, פסקאות בודדות או ציוצים, אבל ייחתך אם תנסו להזין לו מסמך מלא.

כמה משאבים צריך כדי להריץ אותו בזמן אמת?

מעט מאוד. בזכות משקל של 1.7 גיגה־בייט, הוא רץ בלי בעיה על GPU פשוט עם 4GB זיכרון, ואפילו על מעבד רגיל של שרת בסיסי אם נפח הבקשות נמוך.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.7 גיגה־בייט, כך שלא צריך שרת מפלצתי בשביל להריץ אותו. כל מעבד גרפי סטנדרטי עם כמה גיגה־בייט בודדים של זיכרון יחזיק אותו בקלות בזמן הסקה, ואפשר אפילו להריץ אותו על מעבד מרכזי רגיל אם השיהוי לא קריטי לכם בעשיריות השנייה.

מריצים אותו ישירות דרך ספריית transformers בפייתון. במקום להסתמך על שירות ענן חיצוני ולשלם על כל קריאה, הגודל הצנוע שלו מאפשר לכם להרים אותו מקומית בקונטיינר קטן, ללא עלויות שוטפות משמעותיות מעבר לשרת הבסיסי.

from transformers import pipeline

pipe = pipeline("text-generation", model="mrm8488/t5-base-finetuned-emotion")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצר לא פרסם רישיון שימוש עבור המודל. מבחינה משפטית, היעדר רישיון משמעו שכל הזכויות שמורות ואין אישור מפורש להשתמש בו, להפיץ אותו או לשלב אותו במוצר מסחרי. לשימוש פנימי או מחקרי זה פחות מסוכן, אך לחברות מסחריות לא כדאי להכניס אותו לפרודקשן בלי לברר קודם מול היוצר.

הרישיון המלא בעמוד המודל ↗