GPT
J

JailBreakV-28k

קוד פתוח

JailbreakV-28Kmit2024-03-30

המאגר מרכז 28,000 זוגות של תמונה וטקסט שנועדו לפרוץ מודלי שפה רב מודליים. הוא מיועד למי שרוצה לבדוק עמידות של מודלי ראייה ושפה מול מתקפות מתוחכמות.

  • 40,348הורדות בחודש
  • 69לייקים

מה זה

המאגר נשען על RedTeam-2K, אוסף של 2,000 שאילתות מזיקות שמכסות 16 מדיניות בטיחות ונאספו משמונה מקורות שונים, כולל AdvBench, BeaverTails ו־Anthropic hh-rlhf, לצד ניסוחי GPT ושאילתות ידניות. מתוך השאילתות האלה נבנו 28,000 דוגמאות בדיקה המשלבות טקסט ותמונה.

התוכן מחולק לפי שיטות תקיפה. יש כאן 20,000 מתקפות מבוססות טקסט שהועברו ממודלי שפה רגילים בשיטות כמו עומס קוגניטיבי, שכנוע ותבניות, ועוד 8,000 מתקפות ייעודיות למודלי ראייה כמו FigStep ומתקפות מבוססות תוכן השאילתה. התמונות במאגר כוללות צילומי טבע, רעש אקראי, טיפוגרפיה, פלטים של Stable Diffusion ודפים ריקים.

מתאים ל

  • בדיקת עמידות מודלי ראייה

    הרצת שאילתות תקיפה מול מודל רב מודלי כדי לראות אם הוא חוסם פקודות זדוניות.

  • הערכת תקיפות טקסט על תמונה

    בדיקה האם מניפולציות של טיפוגרפיה ואיורים עוקפות את מסנני הבטיחות של המודל.

  • בנצ'מרק של מסנני בטיחות

    מדידת אחוזי הצלחה של כלי סינון כמו LlamaGuard מול שאילתות פוגעניות ממקורות שונים.

איפה זה נופל

הנתונים מתמקדים אך ורק באנגלית ואינם כוללים עברית, כך שלא ניתן לבדוק איתם תקיפות בשפות מקומיות. בנוסף, מדובר בדוגמאות תקיפה מוכנות מראש שפורסמו בתחילת 2024, מה שאומר שמודלים חדשים עשויים כבר להכיר את התבניות הללו. הכרטיס גם מזהיר מראש שהחומרים מכילים תוכן פוגעני וטורדני, כך שחובה להגביל את השימוש לסביבות בדיקה מבודדות ולא לחשוף אותם למשתמשי קצה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

כן, הרישיון המדווח הוא MIT ולכן הוא מתיר שימוש מסחרי ללא תשלום. עם זאת, היוצרים מדגישים בתיאור שהמאגר נועד למטרות מחקר וחינוך בלבד בגלל אופי התוכן. יש לוודא שהשימוש הפנימי שלכם עומד בכללי האתיקה והאבטחה של הארגון.

האם המאגר כולל שאילתות או הנחיות בעברית?

לא, כל השאילתות והמתקפות במאגר מבוססות על מקורות באנגלית בלבד. אם המוצר שלכם פונה לקהל ישראלי, תצטרכו לתרגם את השאילתות או לייצר דוגמאות מקבילות. שיטות התקיפה הגרפיות אולי יפעלו על מודלים בעברית, אבל הטקסט עצמו לא נבדק בשפה זו.

מאיפה הגיעו השאילתות הזדוניות בתוך המאגר?

השאילתות נלקחו מתוך שמונה מקורות מוכרים בתחום הבטיחות, ביניהם AdvBench, BeaverTails והמאגר של Anthropic. בנוסף, החוקרים יצרו שאילתות באופן ידני והשתמשו ב־GPT כדי לייצר ולנסח מחדש בקשות מסוכנות. בסך הכל נאספו 2,000 שאילתות בסיס שמכסות 16 קטגוריות של הפרת מדיניות.

במה המאגר הזה שונה ממאגרי Jailbreak רגילים?

מרבית המאגרים בתחום בודקים מודלי טקסט בלבד באמצעות פרומפטים מילוליים. כאן מדובר בבנצ'מרק שמכוון ישירות למודלים מולטימודליים, ולכן הוא משלב 8,000 תמונות שנועדו לבצע את העקיפה דרך ערוץ הראייה. השילוב הזה בודק האם תמונה עם טקסט או רעש מסוגלת לשבור הגנות שמודל הטקסט היה עוצר בקלות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות הנתיב JailbreakV-28K/JailBreakV-28k, כאשר ניתן לבחור בין הקונפיגורציות JailBreakV_28K המלאה, תת הקבוצה mini_JailBreakV_28K, או RedTeam_2K. אין צורך באישור גישה מיוחד כדי להוריד. הטבלאות מגיעות בפורמט CSV לצד תיקיות קבצי תמונה, והשדות העיקריים שצריך לנתח הם jailbreak_query, policy, format, ונתיב התמונה image_path.

from datasets import load_dataset

ds = load_dataset("JailbreakV-28K/JailBreakV-28k")

הרישיון

המאגר מופץ תחת רישיון MIT, שמאפשר שימוש חופשי כולל שימוש מסחרי ושינוי הקוד והנתונים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. הרישיון אינו דורש שיתוף של תוצרים באותו אופן, כך שאימון או הערכה של מודל פנימי אינם מחייבים את פתיחת המודל לציבור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗