GPT
R

real-toxicity-prompts

קוד פתוח

allenaiapache-2.02022-08-17

מאגר של מאה אלף משפטים באנגלית למדידת רמות רעילות והידרדרות במודלי שפה. הוא מאפשר לבדוק מראש אם המודל שלכם יפלוט קללות, עלבונות או איומים בתגובה לטקסטים מהרשת.

  • 28,796הורדות בחודש
  • 123לייקים

מה זה

המאגר כולל מאה אלף קטעי משפטים שנלקחו מתוך OpenWebText, קורפוס טקסטים שמבוסס על קישורים חיצוניים ששותפו ברדיט. כדי לייצר פיזור רחב של רמות בוטות, החוקרים דגמו 25,000 משפטים מתוך ארבע רמות שונות של רעילות, החל מטקסט נקי לחלוטין ועד לתוכן פוגעני במיוחד.

כל משפט חולק לשניים: החלק הראשון משמש כפרומפט להזנה למודל, והחלק השני הוא ההמשך המקורי שנמצא ברשת. הרשומות מגיעות עם ציוני הערכה שחושבו באמצעות Perspective API עבור שני החלקים בנפרד, וכוללות מדדים מפורטים כמו שפה בוטה, עלבונות, איומים, רעילות חמורה והתקפות על זהות.

מתאים ל

  • מדידת רעילות במודלי שפה

    בדיקת הנטייה של המודל לייצר קללות או עלבונות בתגובה לקלטים שונים.

  • בנצ'מרק של מנגנוני סינון

    בחינת היכולת של מסנני בטיחות לעצור פרומפטים מסוכנים לפני שהם מגיעים למודל.

  • השוואת התנהגות מודלים

    הרצת הפרומפטים על מודלים שונים כדי להשוות מי מהם פולט תוכן פוגעני בתדירות גבוהה יותר.

איפה זה נופל

הטקסטים נאספו מקישורים ברדיט ומייצגים אנגלית אינטרנטית טיפוסית, בלי שום כיסוי לשפות אחרות. הציונים מבוססים כולם על כלי אוטומטי חיצוני, Perspective API, ולא על תיוג אנושי, מה שאומר שהטיות של אותו כלי נכנסו ישירות לתוך הנתונים. המאגר מתאים בעיקר להערכה ובדיקה, ולא הייתי משתמש בו לאימון ישיר של מודלים מבלי להבין שאתם חושפים אותם לתוכן בוטה מאוד.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. כל הטקסטים נאספו ממקורות באנגלית בלבד. אם המערכת שלכם עובדת בעברית, הנתונים האלה לא יעזרו לכם לבדוק את התנהגות המודל בשפה המקומית.

האם מותר להשתמש בו לפרויקט מסחרי?

כן, רישיון Apache 2.0 מתיר שימוש מסחרי מלא. אתם נדרשים רק לציין קרדיט ולצרף את תנאי הרישיון המקוריים.

איך נוצרו ציוני הרעילות בדאטהסט?

הציונים לא נקבעו על ידי בני אדם אלא חושבו ישירות באמצעות Perspective API. הציון קיים בנפרד עבור הפרומפט ובנפרד עבור המשך המשפט המקורי.

איך טוענים

הנתונים יושבים בקובץ prompts.jsonl ואין צורך בבקשת גישה מיוחדת כדי להוריד אותו. כל שורה היא אובייקט שמכיל את הפרומפט, ההמשך המקורי, והציונים השונים שהופקו עבורם. בזמן העבודה, השדות העיקריים שמעניינים אתכם הם טקסט הפרומפט ומדדי הרעילות, שאותם משווים מול הטקסט שהמודל שלכם מייצר בפועל.

from datasets import load_dataset

ds = load_dataset("allenai/real-toxicity-prompts")

הרישיון

המאגר משוחרר תחת רישיון Apache 2.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף את המודל או את הפיתוחים שלכם תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗