GPT
R

roberta-base-finetuned-jd-binary-chinese

קוד פתוח

uerרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

מודל סיווג סנטימנט בינארי לביקורות משתמשים בסינית. מתאים למי שצריך תיוג פשוט של חיובי או שלילי על טקסט קצר מתוך אתרי מסחר.

  • 512טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 5,986הורדות בחודש
  • 45לייקים

מה זה

מדובר במודל RoBERTa-Base בעל 12 שכבות שאומן מראש על קורפוס סיני ועבר fine-tuning באמצעות UER-py על נתוני ביקורות משתמשים של JD binary מתוך פרויקט Glyph. המטרה שלו ממוקדת בסיווג בינארי של רגש, כלומר להבדיל בין ביקורת חיובית לשלילית בטקסטים שנכתבו בסינית.

האימון עצמו רץ במשך שלושה אֶפּוֹכִים עם אורך רצף מקסימלי של 512 טוקנים, כאשר המשקלים נשמרו לפי הביצועים הטובים ביותר על סט הפיתוח. אין בכרטיס המודל נתוני דיוק ספציפיים או ציוני מדידה מדויקים עבור JD binary, כך שאי אפשר לדעת מראש מה אחוז הדיוק שלו בלי לבדוק אותו ישירות על הדאטה שלכם.

מתאים ל

  • סיווג ביקורות מוצר בסינית

    מתאים למיון מהיר של חוות דעת מלקוחות לחיוביות או שליליות באתר מסחר.

  • סינון פידבק שלילי

    זיהוי תלונות וביקורות שליליות בסינית כדי לנתב אותן ישירות לטיפול שירות הלקוחות.

  • ניתוח תחושות בסיסי בטקסט

    תיוג סנטימנט בינארי של קטעי טקסט קצרים בסינית בלי צורך באימון מודל מאפס.

איפה זה נופל

הוא מוגבל לשפה הסינית בלבד ולא יודע להתמודד עם עברית או אנגלית. מעבר לזה, הוא אומן ספציפית על סגנון ביקורות של JD, כך שטקסטים ארוכים מעבר ל־512 טוקנים, שפה ספרותית או טקסטים מתחום החדשות והרשתות החברתיות עלולים להניב תוצאות שגויות. הכרטיס לא מספק מדדי ביצועים או פירוט על שגיאות נפוצות, ולכן חובה להריץ סט בדיקות פנימי משלכם לפני שמסתמכים על התיוגים שלו.

שאלות
נפוצות

האם אפשר להשתמש בו לטקסטים בעברית או באנגלית?

לא. המודל אומן מראש על קורפוס סיני ומיועד אך ורק לשפה הסינית. טקסטים בעברית פשוט לא יעבדו.

האם הוא מזהה דירוג מפורט של כוכבים?

לא, הגרסה הזו מיועדת לסיווג בינארי בלבד בין חיובי לשלילי. עבור דירוג מורכב יותר קיים מודל נפרד מאותה סדרה בשם jd-full.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון עם pipeline של sentiment-analysis או בעזרת AutoModelForSequenceClassification. הקבצים שוקלים 1.1 ג'יגה בייט, גודל צנוע שמאפשר להריץ אותו בקלות על מעבד רגיל או על כרטיס מסך בסיסי בלי שום צורך בתשתית כבדה.

אם יש לכם שרת מקומי קטן עם תמיכה בסיסית בפייתון, ההרצה העצמית פשוטה מאוד ולא דורשת משאבים מיוחדים. פנייה לשירותי API חיצוניים תהיה עדיפה רק אם אתם לא רוצים לנהל שרתים בכלל או אם אתם צריכים לטפל בעומסים משתנים בלי להחזיק תשתית דולקת.

from transformers import pipeline

pipe = pipeline("text-classification", model="uer/roberta-base-finetuned-jd-binary-chinese")
print(pipe("שלום"))

הרישיון

היוצרים לא ציינו רישיון שימוש בעמוד המודל. המשמעות היא שאין הרשאה מפורשת להשתמש בו במוצר מסחרי, וכל שימוש כזה כרוך בסיכון משפטי של הפרת זכויות יוצרים עד לבירור המעמד מול המפרסמים.

הרישיון המלא בעמוד המודל ↗