GPT
N

NSFW_text_classifier

קוד פתוח

michelleli99רישיון לא דווח2022-12-10

  • transformers
  • pytorch
  • distilbert
  • text-classification
  • distilroberta

סיווג טקסטים לא הולמים או לא מקצועיים באנגלית בתוך קובץ זעיר של 256 מגה-בייט. מתאים למי שחייב סינון פשוט מקומית בלי לגרור מודלי ענק.

  • 512טוקנים בהקשר
  • 256 MBמשקל הקבצים
  • 13,137הורדות בחודש
  • 110לייקים

מה זה

מדובר בהתאמה של DistilBERT למשימת סיווג בינארית פשוטה, שמחזירה האם טקסט מסוים הוא SFW או NSFW. המפתח אימן אותו על 14,317 פוסטים שנאספו מרדיט באמצעות ה־API של הפלטפורמה, מתוך כוונה לזהות שפה לא מקצועית ותכנים פוגעניים באנגלית.

המודל לא מציג מדדי ביצועים, מטריצות בלבול או דיוק רשמי בעמוד שלו, למעט דוגמה בודדת שבה משפט מעליב קיבל ציון NSFW גבוה. בגודל של כרבע ג'יגה-בייט הוא רץ כמעט על כל דבר, אבל חוסר הנתונים על אחוזי זיהוי שגויים אומר שתצטרכו לבדוק בעצמכם איך הוא מגיב לסרקזם, קללות קלות או סתם שפת דיבור יומיומית.

מתאים ל

  • סינון תגובות באנגלית

    זיהוי מהיר של קללות והעלבות בפורומים דוברי אנגלית, בעלות משאבים אפסית על המעבד.

  • בדיקת תוכן משתמשים בצ'אט

    הורדת תכנים לא מקצועיים לפני שהם נשלחים, כשהתעבורה דורשת בדיקה מקומית מיידית.

  • מיון מוקדם למאגרי מידע

    סריקה ראשונית וסינון גס של טקסטים גולמיים מהרשת לפני עיבוד או שמירה שלהם.

איפה זה נופל

האימון התבסס לחלוטין על 14,317 פוסטים מרדיט ובשפה האנגלית בלבד. זה אומר שהוא מוטה מאוד לסגנון הכתיבה, לסלנג ולנורמות הקהילתיות של רדיט, ואין לו מושג איך להתמודד עם עברית או עם שפות אחרות.

בנוסף, הכרטיס לא מציין שום מדד ביצועים סטטיסטי. אין דרך לדעת מה שיעור ההתראות החיוביות השגויות, מה שיכול להוביל לחסימת משתמשים תמימים אם תשימו אותו כשער אוטומטי בלי בדיקה אנושית מקדימה.

שאלות
נפוצות

האם המודל מזהה תוכן בעייתי בעברית?

לא. המודל הוגדר ואומן על פוסטים באנגלית בלבד. אם תזינו לו טקסט בעברית, התוצאות יהיו חסרות משמעות ולא אמינות.

אפשר להשתמש בו במוצר מסחרי בלי אישור?

לא מומלץ בכלל. בעמוד המודל לא מופיע רישיון, ומצב כזה לא מעניק הרשאה חוקית לשימוש מסחרי ללא הסכמת היוצר.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות פייפליין סיווג טקסט רגיל. הקבצים שוקלים 256 מגה-בייט בסך הכול, כך שאין צורך בכרטיס מסך ייעודי ואפשר להריץ אותו בקלות על מעבד רגיל בכל שרת פיתוח או מחשב מקומי.

אם אתם צריכים תעבורה נמוכה של אלפי בדיקות בודדות, אין שום סיבה לשלם על API חיצוני כשמודל כזה יושב אצלכם בזיכרון בלי להרגיש. לעומת זאת, אם הטקסטים שלכם כוללים שפות נוספות מלבד אנגלית, הרצה שלו פשוט לא תעזור.

from transformers import pipeline

pipe = pipeline("text-classification", model="michelleli99/NSFW_text_classifier")
print(pipe("שלום"))

הרישיון

היוצר לא דיווח על רישיון שימוש בעמוד המודל. מבחינה משפטית, היעדר רישיון מוגדר משאיר את זכויות היוצרים בידי היוצר ולא מעניק היתר שימוש מסחרי, כך שלא כדאי לשלב אותו במוצר מסחרי סגור בלי לפנות למפתח ולקבל אישור מפורש.

הרישיון המלא בעמוד המודל ↗