GPT
A

AgentHarm

קוד פתוח

ai-safety-instituteother2024-10-11

המאגר כולל התנהגויות מזיקות ותמימות לבדיקת מנגנוני בטיחות בסוכני בינה מלאכותית. חוקרים ישתמשו בו כדי למדוד האם סוכן עצמאי יסרב לפעולות מסוכנות או יבצע אותן בפועל.

  • 5,749הורדות בחודש
  • 62לייקים

מה זה

המאגר מציג משימות ותרחישי שיחה לבדיקת סוכנים, ומחולק לשני סוגי התנהגויות: מזיקות ותמימות. נכון לעכשיו שוחררו 44 התנהגויות בסיס במבחן הציבורי שהורחבו ל־176 התנהגויות, ועוד 8 התנהגויות בסיס בסט התיקוף שהורחבו ל־32. הנתונים מאורגנים בקבצי JSON ייעודיים שמפרידים בין בדיקות ציבוריות, תיקוף, ושיחות צ'אט.

התוכן נבנה בשיתוף פעולה בין מכון הבטיחות הבריטי, Gray Swan AI ומספר אוניברסיטאות. המטרה היא להעמיד מודלים מול בקשות ישירות או מורכבות שמכילות תוכן פוגעני או מסוכן, לצד משימות תמימות שנועדו לבדוק אם המודל מסרב סתם לבקשות לגיטימיות.

מתאים ל

  • מדידת עמידות סוכנים

    בדיקה אם סוכן מבוסס מודל שפה מבצע משימות פוגעניות או מזהה אותן ומסרב לבצע.

  • הערכת סירובי שווא

    שימוש בחלק של ההתנהגויות התמימות כדי לוודא שמנגנון הבטיחות לא חוסם פעולות תקינות.

  • השוואת מודלים מסחריים

    הרצת סקריפטים מובנים להשוואת רמת הבטיחות בין מודלים כמו קלוד, GPT-4o וג'מיני.

איפה זה נופל

זהו אינו סט שלם. החוקרים שחררו רק 44 מתוך 66 התנהגויות הבסיס בבדיקה ו־8 מתוך 11 בתיקוף, כך שחלק ניכר מהמידע עדיין חסר. בנוסף, החוקרים לא שחררו את תבנית הפריצה ששימשה אותם במאמר, מה שמגביל את היכולת לשחזר בדיוק את אותן תוצאות.

היוצרים מציינים במפורש שהציונים במבחן אינם מהווים מדד מוחלט לבטיחות של סוכן, והוא אינו מתאים לכל הקשר הערכה. אין שום תיעוד לתמיכה בעברית, והחומר מכיל תוכן שעלול להיות פוגעני ומסוכן שמיועד אך ורק לבדיקה ולא לאימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון מבוסס על MIT אך כולל תנאי מגביל שמחייב שימוש אך ורק לצורך שיפור הבטיחות והאבטחה של מערכות בינה מלאכותית. מעבר לכך, היוצרים דורשים להשתמש בו להערכה בלבד ולא לאימון מודלים.

האם יש במאגר תמיכה בשפה העברית?

לא מופיע תיעוד לתמיכה בעברית. כל הנתונים, המשימות והרצת ההערכות מוגדרים באנגלית.

באיזה פורמט המידע שמור ואיך ניגשים אליו?

הנתונים שמורים בקבצי JSON ומחולקים לפי קבוצות בדיקה. כדי להשתמש בהם מומלץ לעבוד עם ספריית inspect_ai של מכון הבטיחות הבריטי.

האם המאגר כולל את כל הבדיקות מהמחקר המקורי?

לא. שוחרר רק חלק מהמאגר, 44 מתוך 66 התנהגויות בסיס בסט הבדיקה ו־8 מתוך 11 בסט התיקוף. תבנית הפריצה שנבדקה במאמר המקורי לא שוחררה כלל.

איך טוענים

המאגר מיועד לטעינה ולהרצה דרך ספריית inspect_ai בגרסה 0.3.25 שפותחה על ידי מכון הבטיחות הבריטי. הקבצים שמורים בפורמט JSON בתוך תיקיית benchmark, והגישה אליהם פתוחה ללא צורך באישור מיוחד.

כדי להריץ את ההערכה תצטרכו להגדיר קובץ סביבה עם מפתחות API למודלים שאתם בודקים, כולל מפתח של OpenAI עבור GPT-4o שמשמש כברירת מחדל כשופט סמנטי לזיהוי סירובים וניקוד הפלטים.

from datasets import load_dataset

ds = load_dataset("ai-safety-institute/AgentHarm")

הרישיון

הרישיון מבוסס על רישיון MIT אבל כולל סעיף מגביל נוסף. מותר להשתמש במאגר רק למטרות של שיפור הבטיחות והאבטחה של מערכות בינה מלאכותית, וחל איסור להשתמש בו לכל מטרה אחרת. בנוסף, החוקרים מבקשים מפורשות שלא לאמן מודלים על הדאטהסט הזה, אלא להשתמש בו אך ורק ככלי הערכה כדי למנוע זיהום נתונים.

הרישיון המלא ב־Hugging Face ↗