GPT
J

JailbreakHub

קוד פתוח

walledaimit2024-07-02

המאגר כולל פרומפטים אמיתיים שנועדו לעקוף מגבלות בטיחות של מודלי שפה, כפי שנאספו מהרשת. הוא מיועד למי שבונה הגנות וצריך לראות איך תקיפות נראות בפועל ולא במעבדה.

  • 12,363הורדות בחודש
  • 29לייקים

מה זה

הנתונים מבוססים על איסוף נרחב של 15,140 פרומפטים מארבע פלטפורמות שונות בין דצמבר 2022 לדצמבר 2023. החוקרים סרקו קהילות רלוונטיות ברדיט כמו r/ChatGPT ו־r/ChatGPTJailbreak, שרתי דיסקורד ייעודיים לנושא, אתרים שמרכזים הנחיות כמו FlowGPT ו־AIPRM, וכן מאגרי קוד פתוח מוכרים. מתוך כל המאסה הזו בודדו וסווגו 1,405 פרומפטים שהוגדרו בפועל כהתקפות ג'יילברייק מובהקות, שנועדו לשבור את מנגנוני הבטיחות של מודלי שפה.

התוכן מייצג ניסיונות תקיפה אותנטיים שנכתבו על ידי משתמשים בזמן אמת, ומכיל את הניסוחים, הטכניקות ומבני השיחה ששימשו בפועל כדי לעקוף חסימות של מודלים כמו ChatGPT. המאגר מציג את הפרומפטים לצד מקור ההגעה שלהם, ומאפשר לראות את ההבדלים בין התקפות שנבנו על ידי משתמשי קצה בקהילות מקוונות לבין פרומפטים סטנדרטיים שנאספו במקביל מאותם מקורות לצורך השוואה ומחקר.

מתאים ל

  • אימון מסווגי תקיפה

    זיהוי פרומפטים עוינים בכניסה למערכת וסינונם לפני שהם מגיעים למודל השפה.

  • מבדקי חדירות למודלים

    בדיקת עמידות מודלי שפה חדשים מול תבניות עקיפה אמיתיות שנוסו ברשת.

  • מחקר אבטחה של LLM

    ניתוח המבנה והתחביר של טכניקות הנדסת פרומפטים ששימשו להסרת הגנות.

איפה זה נופל

כל הנתונים נאספו בין סוף 2022 לסוף 2023, כך שהם משקפים עולם ישן של הגנות ומודלים. שיטות תקיפה מורכבות יותר שנולדו מאז לא נמצאות כאן. בנוסף, המאגר מתמקד כולו בשפה האנגלית, ולכן אינו מספק מענה לבדיקת עקיפות המבוססות על שפות אחרות, כולל עברית. רוב החומר נאסף מקהילות שעסקו ספציפית ב־ChatGPT, מה שיוצר הטיה משמעותית לכיוון המודלים של חברת OpenAI על פני ארכיטקטורות אחרות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי חופשי, כולל אימון מודלים או פיתוח מנגנוני הגנה סגורים, כל עוד כוללים את תנאי הרישיון המקוריים.

האם יש במאגר פרומפטים בעברית?

לא. המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד, שנאספו מרשתות וקהילות דוברות אנגלית. אם אתם מחפשים לבדוק עקיפות בעברית, תצטרכו לתרגם את הנתונים או לאסוף דוגמאות בעצמכם.

איך נאספו הפרומפטים שנמצאים בפנים?

החוקרים אספו מעל מאה ושישים אלף פוסטים והודעות מפורומים ברדיט, שרתי דיסקורד ואתרי אינדקס לפרומפטים. מתוכם נשלפו כחמש עשרה אלף פרומפטים, ומתוכם בודדו אלף וארבע מאות התקפות בפועל.

מה הגודל של המאגר והאם דרוש שרת חזק לטעינתו?

המאגר קטן מאוד ומכיל בסך הכל קובץ פרקט בודד עם כחמש עשרה אלף שורות. אפשר לטעון ולעבד אותו על כל מחשב אישי רגיל בתוך שניות, ללא צורך במשאבי חישוב מיוחדים.

איך טוענים

המאגר יושב בהאגינג פייס וכולל קובץ נתונים יחיד בפורמט פרקט בשם train-00000-of-00001.parquet לצד קובץ התיעוד. אפשר לטעון אותו ישירות דרך ספריית datasets ללא צורך בהרשאות מיוחדות או אישור גישה מוקדם, שכן הגישה אליו פתוחה לציבור הרחב. הקובץ עצמו קל מאוד וכולל אלפי רשומות בלבד, כך שטעינתו לזיכרון מתבצעת באופן מיידי בכל סביבת פיתוח סטנדרטית. בעבודה עם הנתונים חשוב לבדוק את טקסט הפרומפט עצמו ואת הסיווג שמפריד בין תוכן רגיל לבין ניסיון תקיפה, לצד שיוך הפלטפורמה שממנה הוא נלקח.

from datasets import load_dataset

ds = load_dataset("walledai/JailbreakHub")

הרישיון

הפרויקט מופץ תחת רישיון MIT, מה שמעניק חופש פעולה רחב מאוד ומאפשר שימוש מסחרי, שינוי הקוד והנתונים, שילוב במערכות פנימיות והפצה מחודשת. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים ונוסח הרישיון המקורי. הרישיון אינו כופה שיתוף באותם תנאים, ולכן אימון מודל או פיתוח מסנן בטיחות על בסיס הנתונים הללו אינו מחייב אתכם לפתוח את המוצר הסופי שלכם לעולם תחת רישיון פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗