GPT
H

HarmfulQA

קוד פתוח

declare-labapache-2.02023-08-20

מאגר לבדיקת עמידות מודלים שמכיל שאלות מזיקות לצד שיחות בטוחות ומסוכנות שחולצו מ־ChatGPT. הוא מתאים למי שרוצה לאמן מודל לסרב לבקשות פוגעניות או למדוד את רמת הבטיחות שלו.

  • 1,592הורדות בחודש
  • 47לייקים

מה זה

המאגר מכיל 1,960 שאלות מזיקות שמחולקות לעשרה נושאים רחבים, כמו מדע וטכנולוגיה, רפואה, פילוסופיה, עסקים והיסטוריה. בכל נושא כזה יש כעשרה תתי נושאים, ובכל אחד מהם נאספו 20 שאלות מזיקות דרך שיטת הנחיה שנקראת Chain of Utterances. שני תתי נושאים ספציפיים, כימיה ופילוסופיה פוליטית, הושמטו מהמאגר כי החוקרים לא הצליחו לייצר עבורם את מכסת השאלות הנדרשת.

סביב השאלות האלו נבנו שני סוגי שיחות מול ChatGPT. הסוג הראשון כולל 9,536 שיחות המוגדרות כחולות ובטוחות, שנוצרו באמצעות משחקי תפקידים שיתופיים. הסוג השני מכיל 7,356 שיחות אדומות ומזיקות שנאספו בתהליך של תקיפת המודל. המבנה מאפשר להשוות בין התשובות, כיוון שלשיחות עם אותו מזהה יש את אותן פניות מצד המשתמש וההבדל הוא רק בתגובת המודל. שיחות מסוימות חסרות עקב סינון וניקוי במהלך האיסוף.

מתאים ל

  • הערכת בטיחות מודלים

    הרצת 1,960 השאלות המזיקות על מודל כדי לבדוק כמה פעמים הוא נכשל ומספק תוכן מסוכן.

  • אימון ליישור בטיחותי

    שימוש בזוגות השיחות המקבילות כדי ללמד מודל לענות בצורה בטוחה על פניות בעייתיות.

  • אימון מסווגי תוכן

    בניית מסווג שמזהה שיחות פוגעניות לפי ההבדלים בין השיחות האדומות והכחולות.

איפה זה נופל

כל הטקסטים נאספו מ־ChatGPT בלבד ובשפה האנגלית בלבד, כך שאין כאן שום ייצוג לעברית או לתרבויות מקומיות. הנתונים מבוססים על מה שהמודל ייצר סביב אוגוסט 2023, ולכן תפיסות הבטיחות והפרצות שבו מוגבלות לאותה תקופה. המפתחים גם מודים כי תתי תחומים שלמים כמו כימיה חסרים לגמרי. בנוסף, מדובר בתוכן סינתטי לחלוטין שמודל יצר, ולא בשאלות אמיתיות שאנשים בעולם האמיתי שאלו, כך שיכולות להיות בו הטיות סגנוניות של מנוע המקור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון Apache 2.0 מאפשר שימוש מסחרי חופשי, כולל אימון מודלים פנימיים או מכירת מוצרים המבוססים עליהם. הדרישה העיקרית היא מתן קרדיט ושמירה על תנאי הרישיון והודעות זכויות היוצרים בקוד או בהפצה.

האם יש במאגר תמיכה בשפה העברית?

לא, המאגר כולל שיחות ושאלות בשפה האנגלית בלבד. אם תרצו לבדוק מודל בעברית, תצטרכו לתרגם את השאלות או להשתמש במאגר רב לשוני אחר של אותם חוקרים שנקרא CatQA.

מה ההבדל בין השיחות האדומות לשיחות הכחולות במאגר?

השיחות נבנו בזוגות עבור אותן שאלות בסיס ופניות משתמש. השיחות האדומות מציגות מקרים שבהם המודל שיתף פעולה עם הנחיות פוגעניות, ואילו השיחות הכחולות מציגות תגובות שאינן מזיקות תחת משחק תפקידים.

האם המאגר כולל נתונים של משתמשים אמיתיים?

לא, כל הנתונים יוצרו באופן סינתטי מול מודל ChatGPT באמצעות תבניות הנחיה ייעודיות. אין כאן שיחות של בני אדם מהעולם האמיתי, אלא סימולציות של תקיפה ושיחות בטוחות.

איך טוענים

המאגר זמין להורדה חופשית דרך Hugging Face ללא צורך באישור גישה מיוחד. הקובץ המרכזי שבו מרוכז המידע נקרא data_for_hub.json, כך שניתן לטעון אותו ישירות באמצעות ספריית datasets או לקרוא אותו כקובץ JSON רגיל בפייתון. הרשומות כוללות שדות של מזהה, נושא, תת נושא, השאלה המזיקה עצמה, ואת השיחות המקושרות אליה משני הסוגים.

from datasets import load_dataset

ds = load_dataset("declare-lab/HarmfulQA")

הרישיון

המאגר מפורסם תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של המידע, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי ומציינים שינויים אם נעשו. אין חובה לשתף מודלים שתאמנו עליו תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗