GPT
R

roberta-hate-speech-dynabench-r4-target

קוד פתוח

facebookרישיון לא דווח2022-06-10

  • transformers
  • pytorch
  • safetensors
  • roberta
  • text-classification

מודל סיווג קל משקל שמזהה דברי שטנה מורכבים באנגלית. הוא נוצר כדי להתמודד עם ניסוחים ערמומיים שעוקפים מסננים רגילים, ועושה את זה בלי לדרוש שרת יקר.

  • 125Mפרמטרים
  • 514טוקנים בהקשר
  • 952 MBמשקל הקבצים
  • 72,574הורדות בחודש

מה זה

מדובר בהתאמה של RoBERTa למשימת סיווג טקסט, שנולדה מתוך מחקר של מטא ושותפיה על זיהוי דברי שטנה בעזרת יצירת דוגמאות דינמית. הרעיון במחקר היה לאמן מודלים מול בני אדם שניסו להכשיל אותם בכוונה, והגרסה הזו היא תוצר של סבב האימון הרביעי, שמתמקד בזיהוי קהל היעד של הפגיעה.

עם 12 שכבות וכ־125 מיליון פרמטרים, הוא שומר על גודל קומפקטי שמבצע משימה בודדת. בניגוד למודלי שפה ענקיים שיודעים לעשות הכל לאט, כאן מקבלים כלי שמחזיר תשובה מהירה ונקודתית על טקסטים באנגלית, בלי להעמיס על התשתית.

מתאים ל

  • סינון תגובות באתרים

    הוא רץ מהר על שרת קיים ומסמן תוכן פוגעני באנגלית לפני שהוא מפורסם.

  • ניתוח שיח ברשתות

    מתאים לעיבוד מהיר של מאגרי ציוצים או פוסטים שנאספו לצורכי מחקר.

  • שכבת הגנה לצ'אט

    בודק הודעות טקסט קצרות בזמן אמת בלי לייצר עיכוב מורגש למשתמש.

איפה זה נופל

הוא אומן אך ורק על אנגלית, כך שכל ניסיון לסווג בעזרתו עברית או שפות אחרות ייכשל לחלוטין. בנוסף, חלון ההקשר מוגבל ל־514 טוקנים, מה שאומר שהוא מתאים לפוסטים קצרים, תגובות ברשת וציוצים, ולא למאמרים או מסמכים ארוכים.

כרטיס המודל לא מציג נתוני דיוק מספריים או פירוט על שגיאות נפוצות. מאחר שמדובר במודל מחקרי מ־2022, חובה להעביר אותו מבחני דיוק על הדאטה האמיתי שלכם כדי לראות שהוא לא זורק התראות שווא על שיח תמים שמכיל מילים טעונות.

שאלות
נפוצות

האם המודל מזהה קללות ודברי שטנה בעברית?

לא. המודל אומן אך ורק על השפה האנגלית. טקסט בעברית ייצר תוצאות שגויות לחלוטין ולא ניתן להסתמך עליו.

האם כדאי להשתמש בו במקום במודל גנרטיבי ענק?

כן, אם המטרה היא רק סיווג. הוא זול בהרבה לתפעול, מחזיר תשובה מהירה ואינו סובל מהזיות כמו מודלי שפה גדולים.

איך מריצים

במשקל של פחות מג'יגה-בייט, אתם יכולים להריץ אותו בקלות על כל מעבד מודרני בלי לגעת בכרטיס מסך ייעודי. טוענים אותו ישירות דרך ספריית transformers של פייתון לתוך זיכרון עבודה רגיל, והוא מוכן לעבודה תוך שניות.

אם אתם צריכים לסרוק כמויות עצומות של תגובות בזמן אמת, עדיף להצמיד לו כרטיס מסך בסיסי כדי לסחוט זמני תגובה של מילישניות. שירותי ענן חיצוניים מיותרים פה, כי העלות של להחזיק מודל כזה אצלכם בשרת נמוכה בהרבה מכל תשלום לפי קריאה.

from transformers import pipeline

pipe = pipeline("text-classification", model="facebook/roberta-hate-speech-dynabench-r4-target")
print(pipe("שלום"))

הרישיון

בעמוד המודל לא דווח רישיון כלל. במצב כזה, מבחינה משפטית אין אישור מפורש לשימוש מסחרי או להפצה בתוך מוצר, גם אם הקבצים פתוחים להורדה. אם אתם בונים שירות לחברה או לסטארטאפ, תצטרכו לבדוק את המאמר המקורי או לפנות ליוצרים לפני שאתם משלבים אותו בפרודקשן.

הרישיון המלא בעמוד המודל ↗