GPT
H

hateful_memes

קוד פתוח

neuralcatcherרישיון לא דווח2022-12-01

מאגר שמחבר תמונות וטקסט כדי לזהות תוכן פוגעני בממים. הוא נבנה כדי לבחון מודלים מול שילוב שבו התמונה או הטקסט תמימים לחלוטין לבדם, אבל ביחד מייצרים שנאה.

  • 5,502הורדות בחודש
  • 23לייקים

מה זה

המאגר כולל אלפי ממים שנוצרו במקור על ידי פייסבוק AI לצורך תחרות ב־NeurIPS 2020. כל רשומה מורכבת מקובץ תמונה בפורמט PNG, מחרוזת הטקסט שמופיעה על גבי המם, ותווית בינארית שמציינת אם מדובר בתוכן פוגעני או לא. המטרה של המבנה הזה היא להכריח מודלים לבצע הסקה מולטי-מודאלית אמיתית ולא להסתמך רק על זיהוי מילים בעייתיות בטקסט.

הנתונים מחולקים לקובצי JSONL לפי קבוצות אימון, פיתוח ומבחן. החלוקה כוללת סטים מסוג seen, שהוצגו במאמר המקורי, לצד סטים מסוג unseen שנוספו לתחרות כדי למדוד יכולת הכללה על דוגמאות חדשות. התוויות ניתנות לקבוצות האימון והפיתוח, אך לפי התיעוד אינן מצורפות לחלק מהמבחנים כדי למנוע דליפת נתונים.

מתאים ל

  • אימון מודלים מולטי-מודאליים

    פיתוח ארכיטקטורות שלומדות להצליב מידע מתמונות ומטקסט לצורך סיווג תוכן.

  • מבחן ביצועים להסקה חזותית

    בדיקת יכולת המודל להבין מתי טקסט תמים הופך לעוין בהקשר של תמונה מסוימת.

  • מחקר על הטיות בתיוג

    ניתוח חוסר עקביות של מתייגים אנושיים בזיהוי תוכן פוגעני מורכב.

איפה זה נופל

היוצרים מודים מראש שיש שגיאות תיוג בחלק מקבוצת האימון, מכיוון שההגדרות של שנאה מורכבות ולא כל המתייגים הסכימו על כל מקרה. הנתונים לא נאספו תחת מדיניות השנאה הרשמית של פייסבוק או על ידי בודקים פנימיים שלה. בנוסף, מדובר במאגר מ־2020 שמבוסס כולו על אנגלית ועל דימויים חזותיים מאותה תקופה. אין כאן ייצוג לעברית, לא ברמת הטקסט ולא ברמת ההקשר התרבותי המקומי, ולכן אי אפשר להעביר אותו כמו שהוא למוצר ישראלי בלי איסוף נתונים מקומי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ. בעמוד לא הוגדר רישיון שימוש, והתמונות כוללות חומרים מוגנים של Getty Images. כל עוד תנאי הרישיון בקובץ המצורף אינם מתירים זאת במפורש, החומר מתאים למחקר בלבד.

האם יש במאגר ממים בעברית?

לא. כל הטקסטים במאגר נכתבו באנגלית ומבוססים על הקשרים תרבותיים אמריקאיים ועולמיים. כדי לאמן מודל לזיהוי תוכן פוגעני בישראל, תצטרכו לאסוף ולתייג ממים מקומיים.

איך מחלקים את הנתונים לצורך אימון ובדיקה?

המאגר מגיע מחולק מראש לקובצי JSONL של אימון, פיתוח ומבחן. קיימת חלוקה בין קבוצות seen, שהופיעו במאמר המקורי, לבין קבוצות unseen שנועדו לבחון יכולת הכללה על דוגמאות חדשות מתחרות 2020.

כמה המאגר אמין מבחינת איכות התוויות?

היוצרים מציינים שיש שגיאות תיוג בקבוצת האימון בגלל מורכבות המשימה וחילוקי דעות בין מתייגים. עם זאת, קבוצות הפיתוח והמבחן עברו בדיקות קפדניות יותר ורמת השגיאות בהן אמורה להיות נמוכה בהרבה.

איך טוענים

המאגר מכיל 9,672 קבצים, שרובם המוחלט תמונות בתיקיית img לצד קובצי JSONL שמכילים שורה לכל דוגמה. כדי לעבוד איתו צריך לקרוא את קובץ ה־JSONL הרלוונטי, לפתוח את הנתיב בשדה img, ולמשוך את השדות text ו־label. אין צורך בתהליך אישור גישה ידני והמאגר זמין להורדה ישירה. המחברים מפנים לערכת התחלה בפרויקט MMF של פייסבוק, וממליצים להעריך ביצועים באמצעות AUROC ודיוק דרך ספריות סטנדרטיות כמו sklearn.

from datasets import load_dataset

ds = load_dataset("neuralcatcher/hateful_memes")

הרישיון

בעמוד המאגר לא דווח רישיון רשמי, אף שקיים בו קובץ בשם LICENSE.txt שמכיל את התנאים המלאים. התמונות עצמן כוללות נכסים מחברות מסחריות כמו Getty Images, ודורשות מתן ייחוס מפורש אם מציגים אותן בפרסומים. בגלל היעדר רישיון פתוח ברור והשימוש בנכסים מוגנים, המאגר מיועד למחקר בלבד ומסוכן מאוד לאמן עליו מודלים לשימוש מסחרי.

הרישיון המלא ב־Hugging Face ↗