GPT
R

russian_toxicity_classifier

קוד פתוח

s-nlpopenrail++2022-03-02

  • transformers
  • pytorch
  • tf
  • safetensors
  • bert

סיווג רעילות ברוסית למי שצריך לסנן תגובות גולשים בלי להחזיק שרתים יקרים. הוא אומן ישירות על שפת רחוב ופורומים רוסיים, כך שסלנג מקומי לא מפיל אותו.

  • 178Mפרמטרים
  • 512טוקנים בהקשר
  • 2.0 GBמשקל הקבצים
  • 1,685הורדות בחודש

מה זה

מדובר במודל סיווג טקסט שמבוסס על Conversational RuBERT, ועבר אימון ייעודי לזיהוי תוכן פוגעני בשפה הרוסית. הנתונים שעליהם הוא למד הגיעו ישירות משני מאגרים של תגובות רשת, אחד מהרשת החברתית ok.ru והשני מפורום 2ch.hk הידוע לשמצה בבוטות שלו. החיבור הזה נותן לו היכרות טובה עם קללות, עיוותי מילים וסלנג יומיומי שלא מופיעים בטקסטים רשמיים.

במבחן על סט הבדיקה של 26,270 דוגמאות, המודל מציג דיוק כולל של 0.97. בזיהוי תגובות רעילות הוא השיג ציון דיוק של 0.94 וריקול של 0.92, עם F1 של 0.93 על כמעט חמשת אלפים דוגמאות רעילות. המשמעות בפועל היא שהוא מפספס בערך שמונה אחוז מהרפש, ותופס מעט מאוד תגובות תמימות בטעות. עבור קהילות שמתמודדות עם ספאם או בריונות ברוסית, זה מספיק יציב כדי לשמש כקו הגנה ראשוני שחוסך עבודה אנושית רבה.

מתאים ל

  • סינון תגובות באתרים

    הוא מזהה קללות וביטויים פוגעניים ברוסית שמופיעים בתגובות גולשים, וחוסם אותם בזמן אמת.

  • ניטור ערוצי צ'אט

    מתאים לזיהוי משתמשים בעייתיים בקהילות מקוונות שמדברות בסלנג רוסי של פורומים.

  • ניקוי דאטהסטים

    מאפשר לסנן טקסטים רעילים ממאגרי אימון גדולים ברוסית לפני שמאמנים עליהם מודלים אחרים.

איפה זה נופל

חלון ההקשר מוגבל ל־512 טוקנים בלבד, כך שהוא לא בנוי לנתח פוסטים ארוכים או מאמרים שלמים. האימון התבסס על תגובות מ־ok.ru ו־2ch.hk, מה שיוצר הטיה חזקה לשפת דיבור של פלטפורמות ספציפיות אלו, ולא בטוח שיתפקד באותה רמה על ערוצי טלגרם או טקסט עסקי. בנוסף, הוא מבצע סיווג בינארי פשוט של רעיל או לא רעיל, בלי להבדיל בין סרקזם, איומים, קללות קלות או שנאה ממוקדת.

שאלות
נפוצות

האם הוא מסוגל לזהות טקסט פוגעני בעברית?

לא, המודל מאומן בלעדית על השפה הרוסית. ניסיון להזין לו עברית, אנגלית או שפות אחרות יחזיר תוצאות לא אמינות ולא שמישות.

כמה זיכרון דרוש כדי להריץ אותו בפרודקשן?

הקבצים שוקלים כשני גיגהבייט. בפועל, סביבת ריצה עם ארבעה גיגהבייט זיכרון מערכת או כרטיס מסך בסיסי עם ארבעה גיגהבייט תספיק לחלוטין לביצועים מהירים.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers הרגילה של פייתון עם BertTokenizer ו־BertForSequenceClassification. המשקל הכולל של הקבצים מגיע לשני גיגהבייט בפורמט float32, כך שהוא לא דורש מפלצת חישובית. כרטיס גרפי בסיסי עם ארבעה גיגהבייט זיכרון יריץ אותו בקלות, וגם מעבד מרכזי מודרני ייתן זמני תגובה טובים לטקסטים קצרים של עד 512 טוקנים.

אם יש לכם שרת ייעודי קיים, עדיף בהרבה לפרוס אותו אצלכם מאשר לשלם לספקי ענן לפי קריאה. המודל קל, רץ מקומית בלי תלויות חיצוניות, ומתאים לטיפול באצוות גדולות של תגובות ברקע.

from transformers import pipeline

pipe = pipeline("text-classification", model="s-nlp/russian_toxicity_classifier")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון openrail++. הוא מאפשר שימוש אקדמי ותעשייתי, אבל כולל הגבלות שמחייבות אתכם לא להשתמש בו ליישומים פוגעניים, הפצת שנאה או נזק מכוון, ועליכם להעביר את התנאים הללו הלאה אם אתם מפיצים אותו.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗