GPT
A

Aegis-AI-Content-Safety-Dataset-1.0

קוד פתוח

nvidiacc-by-4.02024-04-17

  • safety
  • content moderation
  • LLM safety
  • toxicity detection
  • aegis

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

אנבידיה ארזה כאן כמעט שתים עשרה אלף שיחות עם תיוגי בטיחות אנושיים לפי שלוש עשרה קטגוריות סיכון. זה בדיוק המאגר שאתם צריכים כדי לאמן מודל ניטור תוכן או לבנות גארדריילס לשיחות.

  • 3,287הורדות בחודש
  • 61לייקים

מה זה

המאגר כולל 10,798 דוגמאות אימון ו־1,199 דוגמאות מבחן של אינטראקציות בין משתמש למודל שפה. הצוות לקח את הפרומפטים מתוך מאגר ההעדפות האנושיות של אנתרופיק בנושא בטיחות, הזין אותם למודל מיסטרל שבעה ביליון כדי לחלץ תשובות מגוונות, ותייג את התוצאות. הרשומות מגיעות בארבע תצורות שונות, החל מפרומפט משתמש בלבד, דרך פרומפט מערכת יחד עם בקשת משתמש, ועד שיחות מרובות שלבים עם תשובות המודל.

התיוג האנושי בוצע על ידי צוות של שנים עשר בודקים ושני אנשי בקרת איכות באנבידיה, שעבדו לפי שלוש עשרה קטגוריות סיכון מוגדרות מראש. הקטגוריות מכסות בין היתר שיח שנאה, אלימות, תוכן מיני, פגיעה עצמית, איומים, נשק, סמים, פרטיות והטרדה. נקודה קריטית למי שמנתח את הנתונים היא שהתיוגים נעשו ברמת הדיאלוג המלא או החלקי, ולא ברמת טוקן בודד, כך שהסיווג תופס את שילוב הפרומפט והתשובה יחד.

מתאים ל

  • אימון מסנני תוכן

    אימון מודלי סיווג שמזהים ומסננים תוכן פוגעני לפי קטגוריות סיכון מוגדרות מראש.

  • הקמת שכבות הגנה

    בניית מעטפת בטיחות בזמן אמת סביב מודלי שיחה כדי למנוע יציאת תשובות מסוכנות.

  • יישור מודלים לבטיחות

    שימוש ברשומות עבור תהליכי התאמה מתקדמים כמו אס אף טי או די פי או.

איפה זה נופל

הטקסטים במאגר נשענים כמעט לחלוטין על השפה האנגלית, ולכן אינם מתאימים לאימון מערכות סינון שמיועדות לעברית או לשפות מקומיות אחרות. בנוסף, כל המעריכים הגיעו מארצות הברית בלבד, מה שמכניס הטיה תרבותית ברורה לגבי מה נחשב פוגעני או בלתי הולם. התשובות נוצרו כולן על ידי מודל מיסטרל ספציפי, כך שהמאגר משקף את נקודות התורפה שלו. חל איסור מוחלט להשתמש בחומר הזה כדאטה ישיר לאימון מודלי שיחה רגילים, אלא אם המטרה היא מערכת סינון, אחרת המודל פשוט ילמד לייצר תוכן רעיל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא סי סי בי וואי 4.0, שמאפשר שימוש מסחרי מלא. הדרישה היחידה היא לתת קרדיט נאות ליוצרים באנבידיה. המודלים שתאמנו על הדאטהסט הזה יכולים להישאר קנייניים וסגורים.

האם הדאטהסט כולל תמיכה בעברית?

לא, המאגר מוגדר רשמית באנגלית בלבד. ייתכנו דוגמאות זניחות בשפות אחרות מתוך מאגר המקור, אך אין בו דאטה רלוונטי למי שבונה מערכת סינון המיועדת לשוק הישראלי או לשפה העברית.

איך נאספו התשובות והסיווגים במאגר?

החוקרים לקחו שאלות מתוך מאגר קיים של אנתרופיק ושלחו אותן למודל מיסטרל כדי לייצר תשובות. לאחר מכן, צוות של שנים עשר מתייגים מארצות הברית בדק את השיחות וסיווג אותן לפי שלוש עשרה קטגוריות נזק.

האם אפשר להשתמש בדאטה לאימון צ'אטבוט רגיל?

חד משמעית לא. המאגר מכיל בכוונה תוכן בוטה, פוגעני ומסוכן כדי ללמד מערכות ממה להיזהר. אם תאמנו עליו מודל שיחה רגיל, הוא ילמד לייצר בעצמו שפה אלימה והטרדות.

איך טוענים

המאגר זמין להורדה ישירה דרך ספריית הדאטהסטס של האגינג פייס ללא צורך בהרשאה מיוחדת או אישור גישה ידני. הנתונים שמורים בקובצי פרקט ייעודיים עבור קבוצת האימון וקבוצת המבחן, מה שהופך את הטעינה למהירה וקלה במיוחד בסביבת פייתון סטנדרטית עם פנדס. שני הקבצים המרכזיים שוקלים מעט יחסית כי מדובר בטקסט נקי בלבד, סך הכל סביב שתים עשרה אלף שורות. בזמן הטעינה כדאי לשים לב למבנה השיחה ולבדוק באיזה מבין ארבעת הפורמטים מופיעה כל רשומה, משום שהתיוגים חלים על הטקסט המשותף של השאלה והתשובה ולא על כל משפט בנפרד.

from datasets import load_dataset

ds = load_dataset("nvidia/Aegis-AI-Content-Safety-Dataset-1.0")

הרישיון

המאגר מופץ תחת רישיון קריאייטיב קומונס מסוג סי סי בי וואי 4.0. הרישיון הזה מתיר שימוש מסחרי ומחקרי חופשי, כולל אימון מודלים פנימיים או מוצריים, בתנאי שאתם נותנים קרדיט ברור ומציינים את מקור הנתונים של אנבידיה. אין דרישה לשתף את המודל המאומן או את הנגזרות באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗