GPT
T

toxigen-data

קוד פתוח

toxigenרישיון לא דווח2022-05-01

מאגר שמכיל מאות אלפי דוגמאות של דיבור שנאה מרומז שנוצרו במחשב. הוא נועד למי שרוצה לאמן או לבדוק מסווגים על טקסטים פוגעניים שלא כוללים בהכרח קללות ברורות.

  • 9,034הורדות בחודש
  • 77לייקים

מה זה

כל הרשומות במאגר נוצרו באמצעות מודל השפה GPT 3 ולא נלקחו משיחות אמיתיות ברשת. הטקסטים מיועדים לזיהוי דיבור שנאה מרומז ועקיף כלפי קבוצות שונות באוכלוסייה, לפי שיטות שפורסמו במאמר המקורי של החוקרים.

הקובץ כולל שדות ברורים: הטקסט שנוצר, הפרומפט ששימש ליצירתו, תיוג בינארי של רעילות הפרומפט, הקבוצה שאליה הטקסט מתייחס, ושיטת הייצור, למשל שימוש באלגוריתם ALICE לעומת דגימת TopK. בנוסף מצורף ניבוי הסתברותי שנמדד מראש על ידי מודל RoBERTa. במאגר יש חלוקה לקבצי אימון ומבחן מתויגים, לצד קבצי פרומפטים שמחולקים לפי קבוצות יעד ספציפיות.

מתאים ל

  • אימון מסווגי שנאה

    אימון מודלים לזיהוי ביטויים פוגעניים מרומזים שאינם מכילים מילות גנאי ישירות.

  • מבחני עמידות למודלים

    בדיקת ביצועים של מסווגים קיימים מול דוגמאות שנאה שנוצרו במיוחד כדי להטעות מערכות ניטור.

  • בדיקת הוגנות לפי קבוצות

    מדידת אחוזי הדיוק וההטיות של מודל כלפי קבוצות אוכלוסייה שונות לפי שדה היעד.

איפה זה נופל

הטקסטים כולם באנגלית בלבד, כך שהם לא יעזרו ישירות למי שבונה כלי עבודה בעברית. בנוסף, כל הדוגמאות הן טקסט סינתטי שנוצר על ידי מכונה במאי 2022 או לפני כן, ולא ביטויים אותנטיים של משתמשים אמיתיים. אם תאמנו מודל רק על הנתונים האלה, הוא עלול ללמוד תבניות כתיבה ספציפיות של GPT 3 ולפספס סלנג, שגיאות הקלדה וצורות ניסוח אנושיות שנפוצות ברשתות החברתיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ להסתמך עליו מסחרית כרגע, מכיוון שלא דווח רישיון פתוח או מסחרי בדף המאגר. מעבר לכך, הגישה לנתונים מותנית במילוי טופס בקשה מראש, ולכן יש לוודא את תנאי השימוש מול החוקרים לפני תחילת העבודה.

האם יש בדאטהסט נתונים בשפה העברית?

לא. כל הרשומות נוצרו בשפה האנגלית בלבד, ואין במאגר ייצוג לשפות אחרות.

מאיפה הגיעו הטקסטים?

הנתונים לא לוקטו מפורומים או מרשתות חברתיות. כל המשפטים נוצרו באופן מלאכותי באמצעות המודל GPT 3 תחת פרומפטים מוגדרים שנועדו לדמות דיבור שנאה מרומז.

איך מקבלים גישה לקבצים?

הקבצים שמורים בפורמטי Parquet ו־CSV אך אינם פתוחים לחלוטין להורדה מיידית. צריך להיכנס לקישור לטופס האופיס שמופיע בתיעוד, למלא את הפרטים ולחכות לאישור הגישה.

איך טוענים

הנתונים מחולקים ל־41 קבצים בפורמטים של Parquet ו־CSV, הכוללים סטים של אימון, בדיקה וקובצי פרומפטים ממוקדים. לפני שאפשר להוריד ולטעון את המידע דרך הקוד, היוצרים דורשים מילוי טופס מקוון של מיקרוסופט לצורך קבלת גישה למאגר. בעבודה עם הנתונים, השדות העיקריים שתצטרכו לשלוף הם generation עבור הטקסט עצמו, prompt_label ללמידה מונחית, ושדה group כדי לסנן או לבחון ביצועים לפי קבוצת אוכלוסייה.

from datasets import load_dataset

ds = load_dataset("toxigen/toxigen-data")

הרישיון

היוצרים לא הגדירו רישיון שימוש בעמוד המאגר. במצב כזה אין אישור מפורש לשימוש מסחרי, ואי אפשר לדעת בוודאות מה מותר לעשות עם מודל שאומן על הנתונים. אם אתם מתכננים להכניס מודל כזה למוצר, מומלץ לפנות קודם לצוות של מיקרוסופט ו־MIT שחתום על הפרויקט ולברר את תנאי ההפצה.

הרישיון המלא ב־Hugging Face ↗