GPT
B

bert-base-multilingual-uncased-sentiment

קוד פתוח

nlptownmit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

המודל הזה חוזה דירוג של 1 עד 5 כוכבים לביקורות מוצר בשש שפות אירופיות. הוא קלאסי למי שרוצה סיווג סנטימנט מהיר ומקומי בלי לשלוח טקסט לשרתים חיצוניים.

  • 167Mפרמטרים
  • 512טוקנים בהקשר
  • 2.5 GBמשקל הקבצים
  • 840,644הורדות בחודש

מה זה

בבסיס שלו יושב מודל ברט רב-לשוני שעבר כוונון ייעודי על מאות אלפי ביקורות מוצר באנגלית, הולנדית, גרמנית, צרפתית, ספרדית ואיטלקית. הוא לא מחזיר רק חיובי או שלילי, אלא ציון מספרי מוגדר של כוכבים, ממש כמו באתרי קניות.

בבדיקות של היוצרים על 5,000 ביקורות לכל שפה, הדיוק המדויק נע בין 57 אחוז בהולנדית ל־67 אחוז באנגלית. זה אומר שהוא מפספס את הכוכב המדויק בשליש עד כמעט חצי מהמקרים. מצד שני, כשבודקים סטייה של עד כוכב אחד לכל היותר, הדיוק מזנק ל־93 עד 95 אחוז בכל השפות. הוא מבין את הכיוון הכללי של הטקסט מצוין, אבל מתקשה להבדיל בין ארבעה לחמישה כוכבים או בין שניים לשלושה.

מתאים ל

  • סיווג ביקורות באמזון

    חיזוי כוכבים לטקסטים באנגלית, גרמנית או צרפתית ישירות מפידבקים של לקוחות.

  • סינון תלונות דחופות

    זיהוי ביקורות עם כוכב אחד או שניים בשפות הנתמכות לצורך הפניה מהירה לשירות.

  • בסיס לאימון נוסף

    משקולות התחלתיות טובות לכוונון על דאטה של סנטימנט עסקי באחת משש השפות.

איפה זה נופל

אם אתם בונים על עברית, תשכחו מזה. המודל אומן ונבדק אך ורק על שש שפות אירופיות ספציפיות, ועברית פשוט לא שם. חוץ מזה, הוא מוגבל ל־512 טוקנים, כך שביקורות ארוכות במיוחד ייחתכו. היוצרים עצמם מציינים באתר שלהם שיש להם גרסה מעודכנת שמפחיתה 40 אחוז מהשגיאות על ביקורות מוצר, כך שאתם מורידים גרסה ותיקה ממרץ 2022 עם שיעור שגיאה לא מבוטל בדירוג המדויק.

שאלות
נפוצות

האם המודל מזהה עברית?

לא. הוא אומן ונבדק רק על אנגלית, הולנדית, גרמנית, צרפתית, ספרדית ואיטלקית. לטקסט בעברית תצטרכו לחפש מודל אחר לגמרי.

מה המשמעות של דיוק בסטייה של כוכב אחד?

זה אומר שאם לקוח נתן 4 כוכבים, המודל פגע בטווח שבין 3 ל־5 כוכבים בכ־95 אחוז מהמקרים. הוא מזהה את רוח הדברים, אבל לא מומלץ להסתמך עליו לחיתוך מספרי קשיח.

איך מריצים

עם 167 מיליון פרמטרים ומשקל קבצים של 2.5 גיגה-בייט, מדובר במשקל נוצה במונחים של היום. אתם יכולים להריץ אותו דרך ספריית transformers על מעבד רגיל לחלוטין בלי להזיע, ובטח שעל כל כרטיס מסך בסיסי עם מעט זיכרון.

אין פה שום סיבה אמיתית לשלם על קריאות API חיצוניות אם יש לכם שרת פשוט זמין. ההרצה המקומית תהיה זולה ומהירה בהרבה, כל עוד מדובר בטקסטים קצרים שלא עוברים את 512 הטוקנים של חלון ההקשר.

from transformers import pipeline

pipe = pipeline("text-classification", model="nlptown/bert-base-multilingual-uncased-sentiment")
print(pipe("שלום"))

הרישיון

רישיון MIT נותן לכם חופש מלא. אפשר לקחת את הקבצים, לשלב אותם במוצר מסחרי, להפיץ, לשנות ולאמן מחדש ללא תשלום תמלוגים, כל עוד משאירים את הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗