GPT
A

ATBench

קוד פתוח

AI45Researchapache-2.02026-01-24

  • agent
  • safety
  • benchmark

המאגר מרכז מסלולי שיחה מלאים של סוכני בינה מלאכותית שמשתמשים בכלים, לצורך בדיקת בטיחות. הוא מיועד למי שרוצה לאבחן בדיוק איפה ומדוע סוכן אוטונומי נכשל בפעולות מורכבות.

  • 2,296הורדות בחודש
  • 39לייקים

מה זה

כל רשומה מייצגת עקבת הרצה שלמה של סוכן, כולל בקשות המשתמש, תגובות המודל, קריאות לכלים ופלט מהסביבה. המאגר כולל שתי גרסאות נפרדות בקובצי JSON. הגרסה הראשית מכילה 1,000 מסלולים עם חלוקה כמעט שווה של 503 מקרים בטוחים ו־497 לא בטוחים, וממוצע של 9.01 תורות ו־3.95k טוקנים למסלול. הגרסה הישנה, ששמה שונה ל־ATBench500, כוללת 500 מקרים בחלוקה שווה של 250 בטוחים ו־250 לא בטוחים, עם ממוצע של 8.97 תורות ו־1.52k טוקנים.

הנתונים נוצרו בתהליך סינתטי מונחה טקסונומיה, שמתחיל מתכנון שלד לפי סיכונים ומאגרי כלים. התהליך כלל יצירת שאילתות, הזרקת סיכונים, הדמיית קריאות לכלים והרצת תגובות. הסינון עבר חוקים מוגדרים, בקרת איכות באמצעות מודלי שפה, ובגרסה הראשית נוספה גם ביקורת אנושית מלאה.

בגרסה הראשית נחשפו 2,084 כלים שונים וסוכנים הפעילו בפועל 1,954 מתוכם. עבור מסלולים מסוכנים מתבצע אבחון לפי טקסונומיה תלת ממדית: מקור הסיכון מתוך 8 קטגוריות, אופן הכשל מתוך 14 אפשרויות, והנזק בעולם האמיתי מתוך 10 קטגוריות.

מתאים ל

  • הערכת בטיחות סוכנים

    בדיקת יכולת המודל לזהות אם רצף פעולות של סוכן אוטונומי בטוח או מסוכן לאורך זמן.

  • אבחון גורמי כשל

    סיווג תקלות של סוכנים לפי מקור הסיכון, אופן התפתחות הכשל והנזק שנוצר.

  • ולידציה למנגנוני הגנה

    בחינת שכבות הגנה ומעקות בטיחות מול התקפות מורכבות כמו הזרקת פקודות דרך תיאורי כלים.

איפה זה נופל

הנתונים נוצרו בסביבה מדומה ומתוכננת מראש ולא נאספו מפעילות חיה של משתמשי קצה, מה שעלול לייצר דפוסים סינתטיים מובהקים. המאגר כולו בנוי באנגלית ואינו כולל עברית כלל. בנוסף, מדובר במאגר הערכה בלבד ללא חלוקה לסט אימון, כך שלא ניתן לאמן עליו מודלים בצורה ישירה אלא רק לבחון ביצועים של מודלים קיימים או מנגנוני הגנה.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן, המאגר זמין תחת רישיון apache-2.0 שמתיר שימוש מסחרי מלא. עליכם לכלול את עותק הרישיון המקורי ולתת ייחוס ליוצרים.

האם יש בדאטהסט נתונים בעברית?

לא, כל עקבות השיחה, הקריאות לכלים וההנחיות נכתבו באנגלית בלבד. אם המוצר שלכם פועל בעברית, תצטרכו לתרגם את המקרים או לבנות מבחנים מקבילים.

האם הנתונים נלקחו ממשתמשים אמיתיים בעולם?

לא, המסלולים נוצרו במנוע ייצור סינתטי מונחה סיכונים עם כלים מדומים. הנתונים עברו סינון של מודלים, חוקים קשיחים וביקורת אנושית מלאה בגרסה העדכנית.

מה ההבדל בין שתי הגרסאות שמופיעות במאגר?

הגרסה העדכנית מכילה 1,000 מסלולים עם 3.95k טוקנים בממוצע, ביקורת אנושית ושדה נימוק לכל תוצאה. הגרסה הישנה כוללת 500 מסלולים קצרים יותר של 1.52k טוקנים ונשמרה לצורכי השוואה היסטורית.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון שם המאגר והקונפיגורציה הרצויה, ATBench או ATBench500, תחת split שנקרא test. הגישה פתוחה לחלוטין ללא צורך באישור מוקדם. יש לשים לב שהסכמה שונה במקצת בין שתי הגרסאות: הגרסה העדכנית משתמשת בשדות id, contents, tool_used, label, risk_source, failure_mode, real_world_harm וכוללת שדה reason ייעודי, בעוד הגרסה הישנה משתמשת בשמות conv_id ו־content וללא שדה הנימוק.

from datasets import load_dataset

ds = load_dataset("AI45Research/ATBench")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש חופשי כולל שימוש מסחרי, שינוי של הקוד והנתונים והפצה מחודשת. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית. הרישיון אינו כופה שיתוף באותו רישיון עבור פיתוחים נגזרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗