GPT
R

roberta-base-finetuned-dianping-chinese

קוד פתוח

uerרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

מודל סיווג טקסטים קלאסי שעבר התאמה לביקורות משתמשים בסינית. מתאים למי שצריך לנתח סנטימנט של לקוחות מפלטפורמת דיאנפינג בלי לבזבז זמן על אימון מאפס.

  • 512טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 3,181הורדות בחודש
  • 74לייקים

מה זה

מדובר במודל שמבוסס על chinese_roberta_L-12_H-768 עם 12 שכבות, שעבר כוונון ייעודי למשימת סיווג על גבי מאגר הביקורות של דיאנפינג, פלטפורמת הצרכנות הסינית. המפתחים אימנו אותו באמצעות UER-py במשך שלושה מחזורים על גבי תשתיות של Tencent Cloud, תוך שמירה של המשקלים הטובים ביותר בכל מחזור על בסיס קבוצת הפיתוח.

בניגוד למודלים מקבילים באותה סדרה שסווגו על ידיעות חדשותיות כמו Ifeng או Chinanews, המודל הזה מתמקד בקוטביות רגשית של טקסט צרכני. כרטיס המודל לא מציג ציוני דיוק מדויקים או מדדי F1 עבור הגרסה הזו, כך שאי אפשר לדעת מה המספרים היבשים, אך הוא נבנה מראש לסווג טקסטים של חוות דעת יומיומיות ולא כתיבה עיתונאית רשמית.

מתאים ל

  • ניתוח ביקורות בסינית

    מתאים למיון חוות דעת מפלטפורמות צרכניות בסין ובדיקת שביעות רצון לפי טקסט חופשי.

  • סינון פידבקים באפליקציות

    זיהוי משובים שליליים של משתמשים דוברי סינית וניתוב מיידי לצוותי תמיכה.

  • מחקר על דאטה קמעונאי

    סיווג אוטומטי של כמויות גדולות של ביקורות היסטוריות שנאספו ברשת הסינית.

איפה זה נופל

הבעיה המרכזית היא שכרטיס המודל לא מפרט את תוצאות המדידה שלו ולא מציג את רשימת התוויות המדויקת שהוא מחזיר. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים, כך שטקסטים ארוכים ייחתכו. המודל מוגבל אך ורק לסינית, ואין מה לנסות להזין לו שפות אחרות. הוא אומן על ביקורות צרכניות מקומיות, ולכן לא יתפקד טוב על טקסטים רפואיים, משפטיים או ניתוח סנטימנט כללי מחוץ להקשר של דירוגי שירות ומוצרים.

שאלות
נפוצות

האם אפשר להשתמש בו לטקסטים בעברית או באנגלית?

לא. המודל עבר אימון וטוקניזציה אך ורק עבור סינית, ומבוסס על אוצר מילים ייעודי לשפה זו. כל ניסיון להזין לו טקסט בשפה אחרת ייכשל או יחזיר תוצאות חסרות משמעות.

איך אפשר לדעת מה התוויות שהוא פולט בסיווג?

הכרטיס לא מציין את שמות התוויות של הדאטה־סט של דיאנפינג. תצטרכו להוריד את המודל, לבדוק את הקובץ config.json שלו כדי לראות את המיפוי בין המזהים לתוויות, או להריץ טקסט בדיקה קצר.

איך מריצים

טוענים אותו ישירות דרך הספרייה transformers באמצעות AutoModelForSequenceClassification והטוקנייזר התואם, או מחברים אותו לתוך pipeline ייעודי של סיווג טקסט. המודל שוקל 1.1 גיגה בייט, כך שאין שום צורך במערך חומרה כבד. כרטיס גרפי פשוט, או אפילו מעבד רגיל בשרת קיים, יספיקו בהחלט כדי להריץ עליו שאילתות בקצב סביר.

אם אתם צריכים לסווג ביקורות בודדות פעם ביום, אין טעם להחזיק שרת דלוק בשבילו. אבל אם יש לכם זרימת נתונים שוטפת בסינית, גודל הקבצים הקטן הופך את ההרצה העצמית לפשוטה וזולה בהרבה משירותי ענן חיצוניים.

from transformers import pipeline

pipe = pipeline("text-classification", model="uer/roberta-base-finetuned-dianping-chinese")
print(pipe("שלום"))

הרישיון

הרישיון של המודל לא דווח בכרטיס. עבור מי שמתכנן להטמיע אותו במוצר מסחרי, זה סיכון משפטי ברור. כל עוד היוצרים לא הגדירו רישיון קוד פתוח מוכר, אין אישור חוקי מפורש להשתמש במשקלים שלו באפליקציות מסחריות.

הרישיון המלא בעמוד המודל ↗