GPT
I

indonesian-roberta-base-sentiment-classifier

קוד פתוח

w11womit2022-03-02

  • transformers
  • pytorch
  • tf
  • safetensors
  • roberta

סיווג סנטימנט מהיר וספציפי לאינדונזית, שרץ מקומית בלי לגעת במודלי ענק יקרים. פתרון ממוקד למי שמעבד תגובות או ביקורות בשפה הזו.

  • 125Mפרמטרים
  • 514טוקנים בהקשר
  • 1.4 GBמשקל הקבצים
  • 92,954הורדות בחודש

מה זה

מדובר במודל שמבוסס על RoBERTa Base באינדונזית, שעבר אימון ייעודי על דאטה־סט בשם SmSA המכיל ביקורות ותגובות משתמשים. הוא שוקל מעט מעל ג'יגה בודד, מגיע עם 12 שכבות, ונועד למשימה אחת בלבד: להחזיר סיווג רגש לטקסט נתון.

במבחני הבדיקה הרשמיים הוא הציג דיוק של 93.2 אחוזים ומדד F1 של 91.02 אחוזים. המספרים האלה מראים שהוא מבדיל היטב בין ביקורת חיובית לשלילית על נתוני המבחן, בלי לבלבל יותר מדי בין המחלקות, לפחות כל עוד הטקסט דומה למבנה של ביקורות רשת רגילות.

מתאים ל

  • ניטור תגובות באינדונזית

    זיהוי מהיר של תלונות או שבחים בפיד תגובות של משתמשים באינדונזיה.

  • ניתוח ביקורות מוצר

    סינון ומיון אוטומטי של ביקורות באתרי מסחר שפונים לשוק האינדונזי.

  • תיעדוף פניות תמיכה

    זיהוי כעס או דחיפות בהודעות נכנסות של לקוחות כדי להקפיץ אותן בתור.

איפה זה נופל

הוא מוגבל לטקסטים קצרים יחסית עם חלון הקשר של 514 טוקנים, כך שאי אפשר לדחוף אליו מאמרים שלמים. מעבר לזה, המודל אומן על שפה אחת בלבד. אם תזינו לו עברית, אנגלית או שילוב סלנג שלא קיים באינדונזית, תקבלו תוצאות חסרות משמעות לחלוטין. הכותב גם מזהיר מראש שההטיות של דאטה־סט הבסיס ושל SmSA נשמרות כאן, ולכן חובה לדגום את הפלטים שלו ידנית מול הנתונים האמיתיים שלכם לפני שסומכים עליו.

שאלות
נפוצות

האם המודל מבין עברית או אנגלית?

לא. הוא עבר אימון ייעודי לאינדונזית בלבד, ואינו מתאים לשום שפה אחרת.

האם צריך GPU ייעודי בשביל להריץ אותו בפרודקשן?

ממש לא. המודל קטן מספיק כדי לרוץ מהר גם על מעבד שרת סטנדרטי בלי להכביד על התקציב.

איך מריצים

אין שום צורך בכרטיסי מסך מפלצתיים כאן. עם 125 מיליון פרמטרים ומשקל כולל של 1.4 גיגה בייט, אפשר להריץ אותו בקלות גם על מעבד רגיל בשרת צנוע, או על כרטיס מסך בסיסי לחלוטין אם רוצים זמני תגובה של מילישניות בודדות.

האינטגרציה היא שורות בודדות עם הספרייה transformers של פייתון דרך הפונקציה pipeline. אם יש לכם קריאות בודדות פעם בכמה שעות, אולי נוח להשתמש בפתרון ענן מנוהל. אם אתם מעבדים זרם קבוע של תגובות, להחזיק אותו על שרת עצמאי יעלה גרושים וייתן ביצועים מעולים בלי תלות ברשת חיצונית.

from transformers import pipeline

pipe = pipeline("text-classification", model="w11wo/indonesian-roberta-base-sentiment-classifier")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, שזה הרישיון הכי פתוח ונוח שיש. אפשר להשתמש בו חופשי בפרויקטים מסחריים, לשנות אותו, להטמיע אותו בתוך מוצר סגור או להפיץ אותו הלאה, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗