GPT
E

Erlangshen-Roberta-110M-Sentiment

קוד פתוח

IDEA-CCNLapache-2.02022-04-20

  • transformers
  • pytorch
  • bert
  • text-classification
  • roberta

מודל קל משקל שמיועד לניתוח סנטימנט בסינית. מתאים למי שחייב סיווג מהיר וזול של טקסטים קצרים בלי להחזיק שרתים יקרים.

  • 512טוקנים בהקשר
  • 390 MBמשקל הקבצים
  • 4,012הורדות בחודש
  • 89לייקים

מה זה

מדובר במודל סיווג טקסט שמבוסס על RoBERTa בסינית, עם 12 שכבות וכמאה ועשרה מיליון פרמטרים. הצוות אימן אותו על שמונה מאגרי נתונים שונים של סנטימנט בסינית, עם סך של 227,347 דוגמאות מתויגות. המטרה כאן פשוטה מאוד, לקבל משפט או פסקה ולפלוט ציוני הסתברות לסנטימנט.

במדדים שפורסמו בכרטיס המודל הוא מציג תוצאות גבוהות של מעל 96 ו־97 נקודות במבחנים כמו ASAP ו־ChnSentiCorp. המשמעות המעשית היא שבמשימות סיווג סטנדרטיות בסינית, הפער בינו לבין הגרסאות הכבדות יותר בסדרה, כולל מודל של 1.3 מיליארד פרמטרים, עומד על שברירי אחוזים בודדים. אין סיבה אמיתית לשלם על מודל ענק כשהגרסה הזו נותנת כמעט את אותם ביצועים.

מתאים ל

  • סיווג ביקורות מוצר בסינית

    ניתוח מהיר של משובי קונים קצרים באתרי מסחר, בזכות אימון ייעודי על מאגרי ביקורות.

  • סינון תגובות ברשתות

    זיהוי תגובות שליליות בפוסטים בסינית בזמן אמת, בלי להעמיס על השרת.

  • מיון פניות תמיכה בסינית

    ניתוב מהיר של פניות משתמשים לפי דחיפות וטון ההודעה לפני מענה אנושי.

איפה זה נופל

הוא מוגבל לחלוטין לשפה הסינית בלבד. אם תזינו לו טקסט בעברית, אנגלית או שפה מעורבת, הוא יחזיר תוצאות חסרות משמעות. מעבר לזה, חלון ההקשר שלו מוגבל ל־512 טוקנים, כך שהוא לא בנוי לניתוח מאמרים שלמים, מסמכים ארוכים או שיחות מורכבות, אלא רק לביקורות ומשפטים קצרים יחסית. מומלץ לבדוק אותו על הדאטה הספציפי שלכם לפני הטמעה, בעיקר אם מדובר בסלנג עדכני.

שאלות
נפוצות

האם המודל תומך בעברית או באנגלית?

לא. המודל אומן אך ורק על טקסטים בסינית. הזנה של עברית תניב פלט שגוי ולא אמין.

האם חובה להחזיק מעבד גרפי כדי להשתמש בו?

אין צורך ב־GPU. עם גודל קובץ של 390 מגה בייט, מעבד רגיל יספיק לרוב השימושים.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון עם BertTokenizer ו־BertForSequenceClassification. שוקל בסך הכול 390 מגה בייט בחמישה קבצים, מה שאומר שהוא עולה לזיכרון בשניות ורץ בלי בעיה על מעבד רגיל בכל מחשב נייד או שרת פשוט, בלי שום צורך בכרטיס מסך ייעודי.

אם יש לכם גרסאות גדולות יותר מאותה סדרה כמו גרסת ה־330M או ה־1.3B, הן ידרשו יותר זיכרון ומשאבים בשביל שיפור זניח בתוצאה. כדאי להריץ אותו עצמאית אם יש לכם נפח עבודה שוטף ורצון לשמור על פרטיות הנתונים, אבל אם מדובר בכמה עשרות קריאות ביום, לפעמים פשוט יותר לחבר API חיצוני מוכן ולא לתחזק שרת.

from transformers import pipeline

pipe = pipeline("text-classification", model="IDEA-CCNL/Erlangshen-Roberta-110M-Sentiment")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 390 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקולות, ולשלב אותו במוצרים סגורים, בתנאי ששומרים על הודעת זכויות היוצרים ומציינים את הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗