GPT
C

civil_comments

קוד פתוח

googlecc0-1.02022-03-02

  • toxic-comment-classification

המאגר מרכז תגובות גולשים מאתרי חדשות עם ציוני רעילות ופגיעה באוכלוסיות שונות. הוא מתאים במיוחד למי שבונה או בוחן מערכות לסינון תוכן פוגעני ומחפש נתונים חופשיים מזכויות יוצרים.

  • 9,968הורדות בחודש
  • 38לייקים

מה זה

הנתונים מבוססים על ארכיון של תוסף התגובות Civil Comments, שפעל בכחמישים אתרי חדשות עצמאיים בשפה האנגלית בין השנים 2015 ל־2017. לאחר שהפלטפורמה נסגרה ב־2017, הטקסטים שוחררו לארכיון פתוח. צוות Jigsaw הרחיב את המאגר והוסיף לו תיוגים עבור תחרות Kaggle שעסקה בהטיות במודלים של זיהוי רעילות.

כל רשומה מורכבת מטקסט התגובה לצד מדדים מספריים רציפים ברמת דיוק של float32. המדדים כוללים רעילות כללית, רעילות חמורה, גסויות, איומים, עלבונות, פגיעה בזהות ותוכן מיני מפורש. המאגר מכיל 1,804,874 רשומות בחלק האימון, ועוד 97,320 רשומות בכל אחד מחלקי הוולידציה והמבחן.

מתאים ל

  • אימון מסווגי תוכן פוגעני

    זיהוי תגובות אלימות, קללות או תוכן בלתי הולם באתרי תוכן ובפורומים באנגלית.

  • בדיקת הטיות במודלי שפה

    הערכת היכולת של מסווגים להבדיל בין שיח על זהויות לבין שיח שנאה בפועל.

  • כיול ספי רגישות לסינון

    התאמת ספי החלטה למערכות מודרציה בעזרת הציונים הרציפים שמצורפים לכל קטגוריה.

איפה זה נופל

כל התגובות נאספו בין השנים 2015 ל־2017 ובשפה האנגלית בלבד, כך שאין כאן מילה אחת בעברית וסלנג רשת עכשווי פשוט לא קיים בו. הכרטיס מציין שהנתונים שימשו למחקר על הטיות לא מכוונות בסיווג טקסט, אך רוב השדות התיעודיים בכרטיס ריקים ולא כוללים פירוט על תהליך התיוג, זהות המתייגים או המגבלות החברתיות שנמצאו בפועל. לפני שמשלבים מודל כזה במערכת חיה, חייבים לבדוק האם ציון הרעילות אינו נותן ענישה עודפת למילים תמימות רק בגלל שהן מזכירות קבוצות זהות מסוימות.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא. המאגר מבוסס כולו על כחמישים אתרי חדשות דוברי אנגלית. אי אפשר להשתמש בו ישירות לאימון מודל עברי ללא תרגום או איסוף נתונים מקומי.

האם מותר להשתמש בנתונים כדי לבנות מוצר מסחרי?

כן. הנתונים פורסמו תחת רישיון CC0 1.0, שמבטל זכויות יוצרים ומאפשר שימוש מסחרי מלא בלי חובת קרדיט ובלי דרישה לחלוק את המוצר הסופי.

כמה מקום בדיסק המאגר דורש בפועל?

קובצי ההורדה שוקלים 414.95 מגה בייט. לאחר פריסה ועיבוד המאגר תופס 661.23 מגה בייט, ובסך הכל הוא צורך 1.08 ג'יגה בייט בזיכרון האחסון.

מה מקור הנתונים ומי תייג אותם?

הטקסטים נלקחו מהארכיון הציבורי של פלטפורמת התגובות Civil Comments. חברת Jigsaw הרחיבה את התיוגים עבור תחרות Kaggle, אך פרטי תהליך התיוג וזהות הבודקים לא מפורטים בכרטיס.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הנתונים המקובלת בלי צורך באישורי גישה מיוחדים. קובצי ההורדה שוקלים 414.95 מגה בייט, והדאטהסט המעובד תופס 661.23 מגה בייט, כך שסך הכל נדרש מקום דיסק של כ־1.08 ג'יגה בייט. הקבצים שמורים בפורמט Parquet המחולק לשני קובצי אימון, קובץ ולידציה וקובץ מבחן. השדות המרכזיים שתרצו לשלוף הם text שמכיל את המחרוזת עצמה והשדות הנומריים שמייצגים את רמות הרעילות השונות.

from datasets import load_dataset

ds = load_dataset("google/civil_comments")

הרישיון

המאגר כולו משוחרר ברישיון CC0 1.0, שמשמעותו נחלת הכלל. אפשר להשתמש בטקסטים ובתיוגים לצרכים מסחריים ומחקריים כאחד, ללא חובת ייחוס, ללא דרישה לשתף נגזרות באותו רישיון וללא מגבלות על מודלים שמאומנים עליו.

הרישיון המלא ב־Hugging Face ↗