GPT
H

hateBERT

קוד פתוח

GroNLPapache-2.02022-03-02

  • transformers
  • pytorch
  • safetensors
  • bert
  • fill-mask

התאמה של ברט לאנגלית שנבנתה כדי להבין קללות וביטויי שנאה ברשת. החוקרים אימנו אותו מחדש על מעל מיליון פוסטים מקהילות שנחסמו ברדיט.

  • 110Mפרמטרים
  • 512טוקנים בהקשר
  • 840 MBמשקל הקבצים
  • 7,944הורדות בחודש

מה זה

מדובר במודל שפה בגודל ברט בסיסי, 110 מיליון פרמטרים וחלון הקשר של 512 טוקנים, שעבר אימון המשך על טקסטים שנמחקו או נחסמו ברדיט. המטרה המקורית שלו היא השלמת מילים מוסתרות, אבל הוא נבנה בעיקר כנקודת מוצא לסיווג של תוכן פוגעני ושיח שטנה באנגלית.

ברט רגיל לא מתמודד טוב עם שפת רחוב, סלנג פוגעני או שיבושים מכוונים של קללות, כי מערכי הנתונים הרגילים נקיים מדי. האימון הממוקד על קהילות בעייתיות חושף את המודל לז'רגון האמיתי של שיח שנאה, ולכן הוא נותן בסיס מדויק יותר למשימות זיהוי טוקסיסיטי באנגלית ביחס למודלים כלליים באותו סדר גודל.

מתאים ל

  • בסיס למסווג שיח שנאה

    אימון שכבת סיווג עליונה לזיהוי קללות ותוכן פוגעני באנגלית, על גבי ייצוגים שמבינים סלנג רעיל.

  • ניתוח מונחי שטנה ברשת

    השלמת מילים מוסתרות לצורך מחקר על האופן שבו משתמשים בקהילות קיצוניות מנסחים ביטויים אסורים.

  • סינון תגובות באנגלית

    זיהוי מוקדם של פוסטים בעייתיים במערכות תוכן קהילתיות לפני שהם מגיעים למנהלים אנושיים.

איפה זה נופל

המודל אומן רק על אנגלית, ככה שלעברית או שפות אחרות הוא לא יעזור בכלל. מעבר לזה, המשימה המוצהרת שלו כאן היא השלמת מילים מוסתרות בלבד, ולא סיווג מוכן לפרודקשן. כדי לזהות שנאה בפועל תצטרכו לאמן עליו ראש סיווג משלכם או להוריד גרסאות מכווננות מהמאגר החיצוני של החוקרים.

קחו בחשבון שהוא נחשף בכוונה לכמות עצומה של טקסטים רעילים, אז כל ניסיון לייצר איתו טקסט או להשלים משפטים בצורה עיוורת יניב בקלות תוכן אלים ופוגעני.

שאלות
נפוצות

האם המודל מוכן לסווג לי טוקסיסיטי מהקופסה?

לא. הארכיטקטורה שלו מוגדרת למשימת השלמת מילים מוסתרות ולא לסיווג של כן או לא. כדי להשתמש בו לסינון תגובות, תצטרכו להוסיף שכבת סיווג ולאמן אותה על מערך נתונים של שיח שנאה, או להוריד מודל מכוונן שכבר עבר את התהליך הזה.

האם אפשר להשתמש בו לאיתור קללות בעברית?

ממש לא. המודל אומן אך ורק על טקסטים באנגלית מתוך רדיט, ואין לו שום הבנה של שפות אחרות או תרבות שיח מקומית. אם תזינו לו עברית תקבלו תוצאות חסרות משמעות לחלוטין.

איך מריצים

בגודל של 840 מגה בייט ועם 12 שכבות בלבד, אפשר להריץ אותו כמעט על כל שרת פשוט, מעבד רגיל או כרטיס מסך בסיסי בלי להזיע. הוא עובד ישירות דרך ספריית transformers של פייתון ולא דורש תשתית מיוחדת.

אם אתם צריכים רק לסווג כמה משפטים ביום, אין טעם להרים שרת ייעודי ואפשר לקרוא לפתרון מנוהל חיצוני. מצד שני, אם יש לכם נפח עבודה קבוע או שאתם מחויבים לפרטיות של המידע, להריץ אותו עצמאית יעלה גרושים מבחינת מחשוב.

from transformers import pipeline

pipe = pipeline("fill-mask", model="GroNLP/hateBERT")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 840 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקולות של המודל הזה מופצים ברישיון apache-2.0, שמאפשר שימוש מסחרי מלא, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים. שימו לב שהחוקרים מציינים בפירוש שלגרסאות המכווננות למשימות ספציפיות עשוי להיות רישיון אחר במאגר החיצוני שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗