GPT
T

toxic-bert

קוד פתוח

unitaryapache-2.02022-03-02

  • transformers
  • pytorch
  • jax
  • safetensors
  • bert

סיווג רעילות מהיר באנגלית שמחזיר ציונים לקללות, איומים ושנאה. מתאים למי שרוצה לסנן טוקבקים מקומית בלי לשלם על כל קריאת רשת.

  • 109Mפרמטרים
  • 512טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 133,149הורדות בחודש

מה זה

מדובר בהתאמה של bert-base-uncased למשימת זיהוי תוכן פוגעני, על בסיס נתוני תחרות ויקיפדיה של Jigsaw מ־2018. הוא מקבל טקסט ומחזיר הסתברות לשש קטגוריות נפרדות: toxic, severe_toxic, obscene, threat, insult ו־identity_hate. במקום לתת תשובה בינארית של כן או לא, מקבלים פירוק שמסביר ממה בדיוק הטקסט מורכב.

במדד התחרות המודל השיג ציון AUC של 0.98636, קרוב מאוד למובילי הטבלה שעמדו על 0.98856 והשתמשו בהרכבי מודלים כבדים. ההבדל המרכזי בינו לבין מודלים אחרים בסדרה הוא המיקוד, הוא מזהה שפה גסה ישירה אבל לא עבר התאמה להפחתת הטיות כלפי קבוצות אוכלוסייה, משימה ששמורה לגרסת unbiased שמבוססת על RoBERTa.

מתאים ל

  • סינון מקדים של תגובות

    זיהוי גסויות ואיומים באנגלית והעברתם לתור בדיקה אנושי לפני פרסום באתר.

  • בקרת צ'אט מרובה משתתפים

    בדיקת הודעות טקסט קצרות בזמן אמת בלי להעמיס עלויות של שירותי ענן חיצוניים.

  • ניתוח היסטוריית שיחות

    סריקת מאגרי תוכן קיימים לצורך תיוג מהיר של שפה פוגענית ברמת דיוק טובה.

איפה זה נופל

הכרטיס מציין במפורש שהמודל נופל בהבנת הקשר ואירוניה. אם תגובה מכילה קללה, סרקזם עצמי או הומור פנימי, היא כמעט בוודאות תסומן כרעילה. המשמעות היא פסילת יתר של משתמשים שלא התכוונו לפגוע. בנוסף, הוא אומן רק על אנגלית, וכל ניסיון להזין לו עברית חסר טעם. המפתחים מדגישים שהכלי מיועד לעזור למנחי תוכן אנושיים או למחקר, ולא לשמש שופט אוטומטי יחיד שחוסם משתמשים על דעת עצמו.

שאלות
נפוצות

האם המודל תומך בטקסטים בעברית?

לא. גרסת toxic-bert אומנה על אנגלית בלבד ומבוססת על מילון מונחים באנגלית. אם אתם צריכים שפות נוספות, קיימת בסדרה גרסה רב-לשונית שמכסה שבע שפות, אך עברית אינה נכללת בהן.

מדוע התוצאות מ־transformers שונות מהספרייה detoxify?

בדף המודל קיימת אזהרה רשמית על פער בתוצאות בין המימושים עקב באג פתוח. כדי לקבל את הביצועים המדויקים שהוצגו במחקר, מומלץ להתקין את ספריית detoxify ולהשתמש בה במקום בטעינה רגילה מההאב.

איך מריצים

טוענים אותו דרך ספריית transformers הרגילה או ישירות מתוך חבילת detoxify בפייתון. עם 109 מיליון פרמטרים ומשקל קבצים של 1.2 גיגהבייט, אפשר להריץ אותו בקלות על מעבד רגיל בכל שרת פשוט, בלי להחזיק כרטיס מסך ייעודי. זמן התגובה לטקסט בודד קצר מאוד.

המפתחים עצמם מזהירים שהמשקלים ב־Hugging Face מניבים לעיתים תוצאות שונות מאשר הקוד בספריית detoxify שלהם, ולכן עדיף למשוך אותו דרך הספרייה הייעודית או מ־PyTorch Hub. אם נפח התוכן שלכם נמוך מכמה אלפי הודעות ביום, פנייה ל־API חיצוני תחסוך תחזוקת שרת, אבל ברגע שיש זרם קבוע שווה להריץ מקומית.

from transformers import pipeline

pipe = pipeline("text-classification", model="unitary/toxic-bert")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי לחלוטין. מותר לשלב אותו במוצר סגור, לשנות את הקוד ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי. אין חובה לפתוח את קוד המקור של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗