GPT
B

bias-detection-model

קוד פתוח

d4dataרישיון לא דווח2022-03-02

  • transformers
  • tf
  • distilbert
  • text-classification
  • Text Classification

סיווג הטיות במשפטים באנגלית בלי להעמיס שרתים כבדים. מיועד למי שמחפש פתרון קל וזול לסינון טקסטים עיתונאיים.

  • 512טוקנים בהקשר
  • 256 MBמשקל הקבצים
  • 10,298הורדות בחודש
  • 54לייקים

מה זה

מדובר במודל סיווג טקסט שמבוסס על distilbert-base-uncased ואומן על מאגר בשם MBAD כדי לזהות הטיות וחוסר הוגנות במשפטים מתוך כתבות חדשות. היוצרים אימנו אותו במשך 30 אופוקים עם גודל אצווה של 16 וקצב למידה של 5e-5, תוך הגבלה לאורך רצף מקסימלי של 512 טוקנים.

התוצאות שלו מציגות פער ברור: דיוק של 76.97% באימון מול 62.00% בלבד בוולידציה, לצד train loss של 0.45 ו־test loss שמגיע ל־0.96. במילים פשוטות, הוא סובל מהתאמת יתר ולא מבריק בהכללה על נתונים חדשים, כך שכדאי לקחת את הסיווגים שלו בערבון מוגבל.

מתאים ל

  • סינון ראשוני באנגלית

    שוקל 256MB ורץ מהר על מעבד רגיל, מתאים לבדיקת הטיות גסה בחדשות.

  • מחקר על הטיות במידע

    נבנה עבור מחקר אקדמי ומאפשר לנתח ביצועי DistilBERT על מאגר MBAD.

  • סיווג טקסטים עיתונאיים

    האימון שלו התמקד ישירות במשפטים מכתבות חדשות עד 512 טוקנים.

איפה זה נופל

הבעיה המרכזית היא הביצועים. דיוק של 62% בוולידציה זה ציון נמוך, קרוב מאוד להטלת מטבע, מה שאומר שהוא יפספס הרבה הטיות וגם יסמן משפטים תמימים כבעייתיים. בנוסף, הוא אומן על משפטים מכתבות חדשות באנגלית בלבד ועד 512 טוקנים, כך שהוא עיוור לחלוטין לעברית ולא מתאים לפסקאות ארוכות או לטקסט משיחות חופשיות.

שאלות
נפוצות

האם המודל תומך בעברית?

לא, המודל אומן על distilbert-base-uncased ומיועד לאנגלית בלבד. אם תזינו לו טקסט בעברית הוא יחזיר תוצאות חסרות משמעות.

האם אפשר להשתמש בו בפרודקשן?

לא הייתי ממליץ על זה. מעבר לעובדה שלא דווח רישיון שימוש, רמת הדיוק בוולידציה עומדת על 62% בלבד, שזה נמוך מדי למערכת שמקבלת החלטות אמיתיות.

איזה חומרה צריך כדי להריץ אותו?

מדובר בקבצים בגודל כולל של 256 מגה בייט שמבוססים על DistilBERT. כל מחשב נייד או שרת ענן פשוט עם מעבד רגיל מריץ אותו בלי שום צורך בכרטיס מסך ייעודי.

איך מריצים

אתם מושכים אותו ישירות דרך ספריית transformers של פייתון באמצעות pipeline של text-classification, וטוענים אותו כמודל TensorFlow בעזרת TFAutoModelForSequenceClassification. המודל כולו שוקל 256 מגה בייט בלבד, כך שלא צריך כאן שום מעבד גרפי מיוחד, וכל מעבד רגיל של שרת פשוט יריץ אותו בקלות.

אם אתם לא רוצים להחזיק תהליך פייתון באוויר או שאין לכם תשתית מוכנה, אפשר לקרוא ישירות ל־Inference API של Hugging Face. לשימוש נקודתי זה חוסך תחזוקה, אבל בגלל המשקל הזעיר שלו, הרצה מקומית בתוך הקוד שלכם תהיה מהירה ונוחה מאוד.

from transformers import pipeline

pipe = pipeline("text-classification", model="d4data/bias-detection-model")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 256 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא ציינו רישיון בעמוד המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בו, להפיץ אותו או לשלב אותו במוצר מסחרי, וזה יוצר סיכון ברור לחברות.

הרישיון המלא בעמוד המודל ↗