GPT
I

in-the-wild-jailbreak-prompts

קוד פתוח

TrustAIRLabmit2024-10-08

המאגר מרכז מעל 15,000 פרומפטים אותנטיים שנאספו ממשתמשים ברשת, כולל 1,405 ניסיונות עקיפת הגנות. הוא נותן דוגמאות חיות לאיך אנשים באמת מנסים לפרוץ מודלי שפה, לא בתנאי מעבדה סינתטיים.

  • 7,179הורדות בחודש
  • 38לייקים

מה זה

החוקרים אספו 15,140 פרומפטים בין דצמבר 2022 לדצמבר 2023 מארבע פלטפורמות עיקריות: קהילות רדידט כמו r/ChatGPT ו־r/ChatGPTJailbreak, שרתי דיסקורד שונים, אתרים כמו FlowGPT ו־AIPRM, ודאטהסטים פתוחים קיימים. מתוך כל המאגר הזה זוהו 1,405 פרומפטים שמוגדרים כ־jailbreak, והשאר הם פרומפטים רגילים שמשמשים כקבוצת ביקורת.

המאגר מחולק לקבצים לפי תאריכי חיתוך, מאי 2023 ודצמבר 2023, ובכל נקודת זמן יש הפרדה בין תצורת jailbreak לתצורת regular. החלוקה הזו מאפשרת לבחון את התפתחות השיטות לאורך שנת הפריצה הגדולה של מודלי שיחה, ולהפריד בין שימוש תמים להתקפות מכוונות.

מתאים ל

  • אימון מסנני בטיחות

    זיהוי וסינון פרומפטים עוינים בכניסה למודל שפה כדי לעצור התקפות עקיפה לפני שהן מגיעות למנוע הראשי.

  • הערכת עמידות מודלים

    הרצת בדיקות חוסן על מודל קיים ובדיקה האם תבניות פריצה נפוצות גורמות לו לפלוט תוכן אסור.

  • מחקר על דפוסי תקיפה

    ניתוח השינויים המבניים והסמנטיים שמשתמשים עושים בניסוח כדי לעקוף הנחיות מערכת.

איפה זה נופל

כל הנתונים מגיעים מרשתות חברתיות ואתרים של חובבי בינה מלאכותית, מה שאומר שיש שם שפה פוגענית, תוכן בוטה והטיה ברורה לסגנון הכתיבה של קהילות ספציפיות ברדיט ובדיסקורד. אין כאן התייחסות לשפות אחרות מלבד מה שהמשתמשים פרסמו בפועל, כך שאין כיסוי מובנה לעברית. בנוסף, הנתונים נאספו עד סוף 2023, והגנות של מודלים מודרניים כבר חוסמות רבות מהשיטות המוקדמות האלה, כמו גרסאות DAN הישנות. אסור להניח שזה מכסה וקטורי תקיפה חדשים.

שאלות
נפוצות

מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון שמוגדר במאגר הוא MIT, והוא מתיר שימוש מסחרי ללא תמלוגים. יחד עם זאת, בעמוד הדאטהסט מופיעה הצהרה שהחומר נועד לצורכי מחקר בלבד. כדאי שהצוות המשפטי יבחן את הפער בין תנאי ה־MIT לבין ההסתייגות של החוקרים.

האם הדאטהסט כולל דוגמאות בעברית?

הכרטיס לא מציין תמיכה רשמית בעברית או סינון לפי שפה. מקורות המידע הם שרתי דיסקורד ופורומים של רדיט שמתנהלים ברובם באנגלית, ולכן כמעט כל התוכן שם באנגלית. אם אתם צריכים לאמן מודל לחסימת jailbreak בעברית, תצטרכו לתרגם את הנתונים או לאסוף דוגמאות מקומיות.

במה המאגר הזה שונה ממאגרי jailbreak סינתטיים?

רוב המאגרים בתחום מיוצרים על ידי מודלים או לפי תבניות קבועות של צוותי בדיקה. כאן מדובר ב־15,140 פרומפטים שמשתמשים אמיתיים כתבו וניסו ברשת על ChatGPT ומודלים דומים בין 2022 ל־2023, מה שמספק תמונה אמיתית של שגיאות כתיב, סלנג וטכניקות הנדסה חברתית.

מה הגודל של המאגר והאם קשה לטעון אותו?

מדובר במאגר קטן יחסית של כ־15 אלף שורות שנשמרות במספר קובצי parquet בודדים. הטעינה מהירה מאוד, אינה דורשת משאבי מחשוב מיוחדים ואפשר להריץ עליה עיבודים גם על מחשב נייד רגיל.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets של Hugging Face בפייתון. אין צורך בבקשת גישה מיוחדת או באישור חוקרים, המאגר פתוח להורדה מיידית. בזמן הטעינה בוחרים את התצורה הרצויה, למשל jailbreak_2023_12_25 עם split של train. הקבצים שמורים בפורמט parquet קל משקל. לפני שמתחילים לאמן מודל, חובה לבצע ניקוי של כפילויות בעמודת הפרומפט, כפי שמציינים החוקרים עצמם בדיונים על הדאטהסט.

from datasets import load_dataset

ds = load_dataset("TrustAIRLab/in-the-wild-jailbreak-prompts")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי ומחקרי, שינוי של הנתונים והפצה שלהם, כל עוד שומרים על הודעת זכויות היוצרים המקורית ונוסח הרישיון. מודל שתאמנו עליו אינו מחויב ברישיון קוד פתוח. עם זאת, החוקרים צירפו הבהרה שהמאגר מיועד לצורכי מחקר בלבד ואוסרים שימוש לרעה, אם כי ברמת הרישיון המשפטי הפורמלי מדובר ב־MIT רגיל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗