GPT
R

rubert-tiny-toxicity

קוד פתוח

cointegratedmit2022-03-02

  • transformers
  • pytorch
  • safetensors
  • bert
  • text-classification

סיווג רעילות ברוסית עם כמעט אפס משאבים. הוא שוקל פחות ממאה מגהבייט ורץ בשבריר שנייה על כל מעבד רגיל.

  • 12Mפרמטרים
  • 512טוקנים בהקשר
  • 90.6 MBמשקל הקבצים
  • 438,153הורדות בחודש

מה זה

המודל הזה לוקח את rubert-tiny ומכוון אותו לזהות קללות, איומים וטקסט לא הולם ברוסית קצרה ולא רשמית, כמו תגובות ברשתות חברתיות. הוא מחזיר חמש תוויות במקביל, כולל האם הטקסט בטוח, מעליב, גס, מאיים, או מסוכן מבחינת פגיעה במוניטין של הכותב.

הייחוד שלו הוא הגודל הזעום. עם 12 מיליון פרמטרים ושלוש שכבות בלבד, הוא מיועד לסינון מהיר מאוד. לפי מדדי ROC AUC שפרסמו המפתחים, הוא מגרד את ה־0.99 בזיהוי קללות, איומים וגסויות רגילות, אבל יורד לאזור ה־0.83 כשמדובר בטקסט שמוגדר מסוכן.

מתאים ל

  • סינון תגובות ברוסית

    זיהוי אוטומטי של קללות ואיומים בטוקבקים ברוסית בזמן אמת, בלי להעמיס על השרת.

  • בקרת תוכן בצ'אט חי

    בדיקת הודעות של שחקנים או משתמשים בעלות אפסית ובמהירות גבוהה על מעבד רגיל.

  • שכבת הגנה לבוטים

    סינון קלט פוגעני ברוסית לפני שהוא מועבר למודל שפה גדול ויקר יותר.

איפה זה נופל

הוא אומן אך ורק על רוסית קצרה ולא רשמית. אם תזרקו עליו עברית, אנגלית, או טקסטים ארוכים ומורכבים, הוא לא יידע מה לעשות איתם. מעבר לזה, תוצאת ה־ROC AUC על קטגוריית dangerous עומדת על 0.8295 בלבד, שזה נמוך משמעותית משאר התוויות. המשמעות היא שעל ניואנסים עדינים של תוכן מזיק שלא כולל קללה מפורשת, אי אפשר להסתמך עליו בעיניים עצומות.

שאלות
נפוצות

האם הוא מזהה קללות ורעילות בעברית?

לא. המודל אומן על נתונים בשפה הרוסית בלבד ולא מתאים לעברית או לשפות אחרות.

האם חובה להשתמש ב־GPU כדי להריץ אותו במוצר?

ממש לא. הוא כולל רק כ־12 מיליון פרמטרים ושוקל כ־90 מגהבייט, כך שמעבד רגיל מריץ אותו במהירות ובקלות.

מה נחשב טקסט בטוח לפי המודל?

לפי הגדרת המפתחים, טקסט נחשב בטוח רק אם הוא מסווג במקביל כלא רעיל וגם לא מסוכן.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers הרגילה של פייתון עם BertForSequenceClassification. הוא שוקל בערך 90 מגהבייט, כך שלא צריך שום כרטיס מסך ייעודי, הוא ירוץ מצוין על מעבד פשוט בכל שרת ענן זול או אפילו בקונטיינר מקומי קטן.

אין שום סיבה לשלם ל־API חיצוני על משימה כזו ברוסית. כשהמודל כל כך קטן ומהיר, להחזיק אותו בעצמכם חוסך עלויות קריאה, מבטל תלות ברשת ומבטיח שהמידע לא יוצא מהתשתית שלכם.

from transformers import pipeline

pipe = pipeline("text-classification", model="cointegrated/rubert-tiny-toxicity")
print(pipe("שלום"))

הרישיון

רישיון MIT חופשי לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשלב אותו במוצר סגור, לשנות את הקוד ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗