GPT
A

Aegis-AI-Content-Safety-Dataset-2.0

קוד פתוח

nvidiacc-by-4.02025-01-10

  • safety
  • content moderation
  • LLM safety
  • toxicity detection
  • nemoguard

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

המאגר כולל 33,416 אינטראקציות מתויגות בין אדם למודל שפה סביב בטיחות תוכן. הוא מיועד למי שבונה מודלי סינון ורוצה שילוב בין פרומפטים מסוכנים, תשובות ממודל לא מיושר ותיוגי סירוב.

  • 7,008הורדות בחודש
  • 109לייקים

מה זה

בבסיס המאגר יושבות שיחות שנבנו מפרומפטים אנושיים שנלקחו ממאגרי Anthropic RLHF, DAN וניסויי Red-Teaming. כדי לקבל תשובות שמכילות פגיעה ממשית ולא חסימות אוטומטיות, החוקרים הריצו את הפרומפטים מול Mistral-7B-v0.1, שמצטיין במילוי הוראות ואינו מיושר בכבדות. התיוגים מסווגים לפי טקסונומיה של 12 קטגוריות סיכון ראשיות ועוד 9 קטגוריות משנה, ביניהן תוכן מיני, אלימות, נשק, פריצה ודיסאינפורמציה.

חלוקת הנתונים כוללת 30,007 דוגמאות אימון, 1,445 דוגמאות ולידציה ו־1,964 דוגמאות בחינה. מתוך סט האימון, 5,000 רשומות הן דוגמאות סירוב סינתטיות שנוצרו באמצעות Gemma-2-27B כדי ללמד מודלים התחמקות נכונה. תיוג הפרומפטים נעשה במלואו בידי אדם, בעוד שתיוג התשובות שילב עבודה אנושית עם פאנל שופטים שמורכב משלושה מודלי שפה שונים.

מתאים ל

  • אימון מסנני תוכן לפרומפטים

    זיהוי פרומפטים עוינים ונסיונות עקיפה לפני שהם מגיעים למודל המרכזי שלכם.

  • אימון מודלי שמירה לתשובות

    בדיקת פלטי מודלים וסיווגם לפני שליחה למשתמשי קצה על פי קטגוריות סיכון.

  • לימוד אסטרטגיות סירוב

    אימון מודלי שפה על אלפי דוגמאות הסירוב המובנות להתחמקות מנומסת מבקשות רעילות.

  • הערכת עמידות של מודלים קיימים

    שימוש בסט המבחן כדי לבדוק מנגנוני בטיחות קיימים מול מתקפות Red-Teaming.

איפה זה נופל

כל התוכן במאגר נשען על השפה האנגלית, וכל 12 המתייגים האנושיים מתגוררים בארצות הברית. ההגדרות למה נחשב שנאה, הטרדה או טאבו משקפות תרבות אמריקאית מובהקת ולא התאמות מקומיות בישראל. תשובות המודל נשענות בעיקר על מודל יחיד, Mistral-7B-v0.1, לצד תיוגים של שופטים סינתטיים שעלולים לפספס הקשרים מורכבים. אסור להשתמש בטקסטים האלה לאימון סוכני שיחה כלליים, כי המאגר מלא בתוכן רעיל ומסוכן שיזהם את המודל שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון CC-BY-4.0 מאפשר שימוש מסחרי מלא, כולל אימון מודלים פנימיים או מוצרים שנמכרים ללקוחות. התנאי היחיד הוא מתן קרדיט ברור ל־Nvidia בתיעוד.

האם המאגר רלוונטי למוצרים שפועלים בעברית?

כמעט ולא באופן ישיר. הטקסטים כולם באנגלית ומבוססים על שיח אמריקאי. אפשר להשתמש בו לאימון שכבת בטיחות לשפה האנגלית, אבל הוא לא יעזור לכם לזהות קללות, איומים או הקשרים תרבותיים בעברית.

למה התשובות נוצרו דווקא עם Mistral-7B-v0.1?

החוקרים רצו דוגמאות אמיתיות של תוכן פוגעני ולא הודעות שגיאה. מודלים מודרניים מסרבים לענות לבקשות מסוכנות בגלל יישור בטיחות כבד, בעוד הגרסה הזו של מיסטרל ממלאת הוראות בצורה עיוורת יחסית ומייצרת פלטים רעילים שאפשר לתייג.

האם כל הדאטה זמין להורדה מיידית?

רובו המוחלט כן, מלבד 358 דוגמאות בקטגוריית אובדנות ופגיעה עצמית. הטקסטים שלהן הוחלפו בסימון REDACTED משיקולי פרטיות והפצה, ומי שרוצה לשלב אותם צריך להוריד בנפרד קובץ מקגל ולחבר לפי מזהים.

איך טוענים

הנתונים מגיעים בקובצי JSON פשוטים כמו train.json ו־test.json, לצד קבצים נפרדים של נתוני סירוב כמו refusals_train.json. אין צורך באישור גישה מיוחד או בהרשמה. כל רשומה כוללת תשעה שדות, כאשר העיקריים שבהם הם prompt, הטקסט של response, תוויות הבטיחות prompt_label ו־response_label, ומחרוזת הטקסונומיה violated_categories. שימו לב שבחלק מדוגמאות האובדנות הפרומפט מופיע כמחוק עם המילה REDACTED, ותצטרכו למשוך אותו ידנית לפי מזהה ממאגר חיצוני בקגל.

from datasets import load_dataset

ds = load_dataset("nvidia/Aegis-AI-Content-Safety-Dataset-2.0")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, כל עוד אתם מעניקים קרדיט מתאים ליוצרים ומציינים אם נעשו שינויים. אין דרישה לשתף תוצרי מודלים תחת אותו הרישיון, כך שניתן לאמן עליו מודלי הגנה קנייניים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗