GPT
T

Text-Moderation

קוד פתוח

KoalaAIopenrail2023-10-05

  • transformers
  • pytorch
  • onnx
  • safetensors
  • deberta

מודל סיווג קל לסינון תוכן פוגעני באנגלית, שמחזיר הסתברויות לתשע קטגוריות שונות. פתרון מהיר כשרוצים לבדוק טקסטים קצרים מקומית בלי לשלם על קריאות חיצוניות.

  • 139Mפרמטרים
  • 512טוקנים בהקשר
  • 2.8 GBמשקל הקבצים
  • 18,604הורדות בחודש

מה זה

הבסיס כאן הוא DeBERTa-v3 עם 139 מיליון פרמטרים, מאומן למשימת סיווג מרובת מחלקות של טקסטים פוגעניים. הוא מפרק את התוכן לקטגוריות ברורות כמו שנאה, אלימות, הטרדה, פגיעה עצמית ותוכן מיני, עם הפרדה לרמות חומרה קיצוניות יותר כמו אלימות גרפית או תוכן שמערב קטינים.

תוצאות הוולידציה שלו מציגות דיוק כללי של כמעט 75 אחוז, אבל הנתון המעניין באמת הוא Macro F1 של 0.326 לעומת Weighted F1 של 0.703. הפער הזה חושף בעיה שכיחה, רוב הדאטה מורכב מטקסטים תקינים, ובמחלקות הנדירות והקריטיות המודל מתקשה לתפוס מקרים או מפספס משמעותית.

מתאים ל

  • סינון תגובות באנגלית

    זיהוי מהיר של קללות, הטרדות ואלימות בתגובות משתמשים קצרות לפני פרסומן.

  • שכבת הגנה לצ'אטבוטים

    בדיקת הפלט והקלט של מודלי שפה גדולים כדי לעצור שיח על פגיעה עצמית או שנאה.

  • תיעדוף תלונות משתמשים

    ניתוב אוטומטי של דיווחי תוכן פוגעני לצוות אנושי לפי חומרת הקטגוריה שנמצאה.

איפה זה נופל

המודל אומן אך ורק על אנגלית, ולכן לא יעבוד על עברית. חלון ההקשר מוגבל ל־512 טוקנים, כך שהוא לא בנוי למאמרים או מסמכים ארוכים אלא לפוסטים קצרים. בנוסף, מדדי ה־Macro הנמוכים מעידים שהוא נוטה לפספס ביטויי שנאה או פגיעה עצמית שאינם מנוסחים בצורה בוטה וישירה, ויוצריו מזהירים מראש מהטיות ומהיעדר הבנת הקשר רחב.

שאלות
נפוצות

האם הוא מזהה עברית?

לא. המודל אומן אך ורק על טקסטים באנגלית, וקלט בעברית יוביל לתוצאות שגויות או לזיהוי שגוי כתוכן תקין.

אפשר לסמוך עליו שיחסום פגיעה עצמית באופן מוחלט?

לא כדאי להסתמך עליו לבד. מדד ה־Macro F1 הנמוך מראה שהוא מתקשה בקטגוריות נדירות, וביטויים מרומזים עלולים לעבור מתחת לרדאר שלו.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון או פונים אליו דרך השרתים של Hugging Face. עם משקל קבצים של 2.8 גיגה בייט וכמות פרמטרים קטנה, אפשר להריץ אותו בלי שום בעיה על מעבד רגיל, אם כי כרטיס מסך פשוט ייתן זמני תגובה של מילישניות בודדות לכל טקסט.

אם כל מה שאתם צריכים זה לסנן תגובות באתר קיים בהיקף נמוך, קריאה ל־API של Hugging Face תחסוך את כאב הראש של תחזוקת שרת. לעומת זאת, כשיש נפח תנועה רציני ודרישה לפרטיות מוחלטת, הוא קל מספיק כדי לשבת כקונטיינר מקומי זול.

from transformers import pipeline

pipe = pipeline("text-classification", model="KoalaAI/Text-Moderation")
print(pipe("שלום"))

הרישיון

הרישיון הוא CodeML OpenRAIL-M 0.1, גרסה שמאפשרת שימוש מסחרי ומחקר, כולל שינוי והפצה של המודל. התנאי המרכזי דורש לצרף עותק של הרישיון, ויש בו הגבלות שימוש שאוסרות ניצול לרעה, פגיעה באנשים או הפרת חוק. אין עליו תשלום, אבל החוזה משפטי מחייב.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗