GPT
N

Nemotron-AIQ-Agentic-Safety-Dataset-1.0

קוד פתוח

nvidiaother2025-10-23

  • agentic-safety
  • ai-safety
  • red-teaming
  • attack-detection

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

תיעוד ביצוע מלא של סוכן מחקר מבוסס מודל נמוטרון תחת מתקפות אבטחה ותוכן מסוכן. המאגר נותן מעקב שלב אחר שלב אחרי דליפת מידע וסירובים במערכות מרובות שלבים.

  • 3,879הורדות בחודש
  • 17לייקים

מה זה

המאגר כולל כעשרת אלפים ושמונה מאות עקבות ריצה מלאות שנוצרו בהרצת עוזר המחקר AIQ, המבוסס על Llama 3.3 Nemotron Super 49B v1, בשיתוף חברת Lakera AI. הנתונים מתעדים שאילתות מזיקות לצד תמימות שנוצרו בצורה אדפטיבית, כדי לבדוק מתי המערכת מפיקה דוח ומתי היא מסרבת, כולל מקרים שבהם המודל החזיר תשובות מזיקות ברמה גבוהה. האיסוף והתיוג התבססו על שילוב של הפקה סינתטית, אוטומציה ובדיקה אנושית.

התוכן מחולק לשתי תצורות: אבטחה ובטיחות תוכן. כל תצורה מפוצלת לשני חלקים, עם מנגנוני הגנה ובלי הגנה, בכמות של כאלפיים ושש מאות עד אלפיים ושמונה מאות עקבות לכל חלק. כל רשומה מורכבת ממזהה ריצה, אובייקט מטא דאטה של פרטי המתקפה, ורשימת שלבי ביצוע פנימיים הכוללים קלטים, פלטים וקריאות לכלים ולמודל.

מתאים ל

  • הערכת עמידות של סוכנים

    בדיקת התנהגות מנגנוני סירוב וסינון קלט מול שאילתות תוקפניות שנוצרו באופן מותאם.

  • ניתוח זליגת מתקפות בשלבים

    מעקב אחר חדירת הוראות זדוניות בין מקטעי הריצה השונים בעזרת נתוני הטלמטריה.

  • מדידת יעילות שכבות הגנה

    השוואת ציוני הסיכון וההצלחה של המתקפות בין הריצות המוגנות לאלה שפעלו ללא הגנה.

איפה זה נופל

החומר מתמקד כולו בשפה האנגלית, כך שאין שום כיסוי להתקפות בעברית או במבנים רב לשוניים. כל הריצות מייצגות ארכיטקטורה מאוד מסוימת של עוזר המחקר של אנבידיה עם מודל ספציפי, ולכן התוצאות והסיכונים לא בהכרח ישקפו התנהגות של סוכן שנבנה עם מודל או שלבי עבודה אחרים. בנוסף, המאגר מכיל טקסטים פוגעניים ואלימים כחלק מבדיקות החדירה, ואינו כולל נתונים עדכניים מעבר למועד יצירתו בסוף אוקטובר 2025.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לאימון מודל?

לא. תנאי השימוש מגדירים אותו לצורכי מחקר והערכה פנימית בלבד, ומציינים במפורש שאין להשתמש בו כסט נתונים לאימון מודלים בשלב זה.

האם יש במאגר דוגמאות בעברית?

לא. הנתונים מתמקדים אך ורק בשפה האנגלית, וכל השאילתות ושלבי הריצה מנוסחים באנגלית בלבד.

כמה שוקל המאגר ובאיזה פורמט הוא מגיע?

המשקל הכולל הוא 2.5 גיגה בייט. הוא זמין גם בקובצי Parquet מוכנים לטעינה וגם בקובצי JSON גולמיים ומניפסטים בפורמט JSONL.

איך הנתונים נאספו ונבדקו?

הנתונים הופקו משאילתות אדפטיביות שהורצו על מערכת AIQ בשיתוף חברת Lakera AI. תהליכי האיסוף והתיוג התבצעו בשיטה היברידית ששילבה יצירה סינתטית, אוטומציה ובדיקה אנושית.

איך טוענים

נפח הקבצים עומד על 2.5 גיגה בייט והם פתוחים להורדה ישירה ללא טופס גישה. המאגר מוגש בקובצי Parquet מוכנים לטעינה נוחה, לצד קובצי JSON גולמיים וקובצי JSONL של תיאורי המתקפות בכל תיקייה. המבנה מבוסס על תקן OpenTelemetry שבו השדה trace מכיל מערך של מקטעי ביצוע עם זמנים, שגיאות, קלטים ופלטים. שדה המטא דאטה שונה בין התצורות: באבטחה מופיעים ציוני סיכון לכל צומת, ובבטיחות יש מדד התפשטות המתקפה ודגל בוליאני להצלחה סופית.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-AIQ-Agentic-Safety-Dataset-1.0")

הרישיון

המאגר מופץ תחת רישיון ייעודי בשם NVIDIA Evaluation Dataset License Agreement. התנאים אוסרים במפורש שימוש לאימון מודלים בשלב זה, והשימוש המותר הוא בלבד למחקר, פיתוח, והערכה פנימית של פתרונות בינה מלאכותית בתחומי בטיחות ואבטחה.

הרישיון המלא ב־Hugging Face ↗