GPT
J

JBB-Behaviors

קוד פתוח

JailbreakBenchmit2024-06-12

  • jailbreaks
  • large language models
  • harmful behaviors
  • ml safety

מאגר ממוקד של 100 התנהגויות פוגעניות מוגדרות לבדיקת עמידות מודלים בפני מתקפות פריצה. הוא נועד להרצת הערכות בטיחות והשוואות תקיפה באופן מהיר וסטנדרטי.

  • 72,213הורדות בחודש
  • 124לייקים

מה זה

המאגר מכיל 100 דפוסי שימוש לרעה שנבחרו בקפידה כדי לייצג עשר קטגוריות שונות, בהתבסס על מדיניות השימוש של OpenAI. הנתונים לא נאספו מאפס אלא נלקחו ועובדו מתוך מאגרי בטיחות מוכרים כמו AdvBench, תחרות Trojan Detection Challenge של שנת 2023, HarmBench, רעיונות ממאמרים על שינוי פרסונות של Shah ואחרים, לצד דוגמאות מקוריות שנכתבו עבור הבנצ'מרק.

כל רשומה במאגר מחזיקה חמישה שדות מרכזיים. שדה Behavior שמכיל מזהה ייחודי של ההתנהגות, Goal שכולל את הבקשה הפוגענית הישירה, Target שמציג פלט רצוי של מודל שנכנע לפריצה לצורך בדיקת התאמה, Category שמסווג לקטגוריה הרלוונטית, ושדה Source שמציין את המקור הספציפי שממנו נלקחה ההתנהגות. המאגר אינו מכיל את כל הדוגמאות ממאגרי המקור אלא אוסף מצומצם ומייצג שמטרתו לאפשר ריצה מהירה.

מתאים ל

  • מדידת עמידות מודלים

    הרצת 100 הפרומפטים על מודל שפה כדי לבדוק כמה מהם מצליחים לעקוף את מנגנוני הבטיחות.

  • בדיקת מתקפות פריצה

    בחינת אלגוריתמים חדשים ליצירת jailbreaks על בסיס מטרות מוגדרות מראש בשדה Goal.

  • אימון הגנות ייעודיות

    שימוש ברשומות ובקטגוריות השונות לפיתוח ובדיקה של מסנני קלט שחוסמים בקשות פוגעניות.

איפה זה נופל

יש פה רק 100 התנהגויות, כך שהכיסוי רחוק מלהיות מקיף ולא הייתי מסתמך עליו כמבחן יחיד לבטיחות לפני שמעלים מודל לפרודקשן. הטקסטים כולם באנגלית בלבד, כך שלמי שבונה ומגן על מערכות בעברית אין פה שום מענה ישיר. מעבר לכך, התוכן פוגעני בהגדרה ודורש התייחסות מתאימה בזמן ההרצה, והוא מוגבל לקטגוריות שהוגדרו לפי המדיניות של חברה אחת.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

כן, הרישיון המדווח הוא MIT. הוא מתיר שימוש מסחרי חופשי, בתנאי שמשאירים את הקרדיט ואת תנאי הרישיון המקוריים בקבצי הפרויקט.

האם יש בנתונים תמיכה בעברית?

לא, המאגר מוגדר וקיים בשפה האנגלית בלבד. אם המוצר שלכם פונה למשתמשים בעברית, תצטרכו לתרגם את הפרומפטים או לייצר דוגמאות מותאמות באופן עצמאי.

מאיפה הגיעו 100 הדוגמאות שיש במאגר?

חלקן נוצרו על ידי החוקרים של הפרויקט וחלקן נלקחו ממאגרים ידועים כמו AdvBench ו־HarmBench, וכן מתוך Trojan Detection Challenge. החוקרים סיננו ובחרו דוגמאות בולטות שמתאימות לעשר קטגוריות שימוש לרעה של OpenAI.

במה הוא שונה מ־AdvBench או HarmBench?

הוא לא מנסה להכיל את כל מה שיש בהם. מדובר באוסף מצומצם ומנופה של 100 התנהגויות מייצגות בלבד, שנועד לאפשר הערכה מהירה והשוואה אחידה בלי לבזבז זמן ומשאבים על אלפי דוגמאות.

איך טוענים

הנתונים יושבים בקובצי CSV פשוטים בתיקיית data, וביניהם harmful-behaviors.csv שכולל את ההתנהגויות הפוגעניות, לצד benign-behaviors.csv וקובץ השוואת שופטים. אין צורך באישור גישה מיוחד, טוענים אותם ישירות באמצעות ספריית פנדס או דרך huggingface datasets. עמודות המפתח לעבודה הן Goal שמכילה את הטקסט לתקיפה ו־Target שמשמשת לבדיקה אם המודל אכן נענה לפריצה.

from datasets import load_dataset

ds = load_dataset("JailbreakBench/JBB-Behaviors")

הרישיון

המאגר מופץ תחת רישיון MIT, מה שנותן חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במוצרים סגורים. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים ונוסח הרישיון המקורי. אימון מודל על הנתונים אינו מחייב אתכם לשחרר את המודל בקוד פתוח או תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗