GPT
T

toxic-dpo-v0.1

קוד פתוח

unalignmentcc-by-4.02023-12-11

  • not-for-all-audiences

המאגר מרכז דוגמאות טקסט רעיל שנועדו להסיר חסימות ממודלים בעזרת אימון העדפה ישיר. הוא מתאים למי שחוקר עקיפת מנגנוני בטיחות או רוצה לבדוק כמה מעט דאטה נדרש כדי לשבור יישור.

  • 98הורדות בחודש
  • 141לייקים

מה זה

המאגר כולל זוגות של תשובות שנבנו סביב תוכן מזיק, פוגעני וקללות, במטרה לבחון ביטול צנזורה במודלים של שפה. הרשומות מבוססות כולן על טקסט סינתטי שיוצר על ידי מודלים ולא נכתב בידי בני אדם. התשובה המועדפת, זו שמסירה את החסימה, הופקה מתוך llama-2-70b באמצעות הנדסת פרומפטים ממוקדת. התשובה הדחויה הופקה ישירות מהמודל הסגור והמיושר llama-2-13b-chat-hf שסירב לבקשות.

היוצר מציין כי רוב הדוגמאות שנבחרו עדיין כוללות אזהרות והסתייגויות מסוימות בתוכן, כך שהטקסט עבר עריכה חלקית ולא מייצג מענה גולמי לחלוטין. מטרת האיסוף הייתה להדגים שאפשר לפרוץ יישור של מודל באמצעות מעט מאוד דוגמאות אימון, בלי צורך במאגרי ענק של תוכן מסוכן. אין בכרטיס פירוט לגבי חלוקה מובנית לחלקי בדיקה ואימון או סינון ידני נוסף מעבר לכך.

מתאים ל

  • מחקר ביטול צנזורה

    בדיקת כמות הדוגמאות המינימלית הנדרשת כדי לשבור יישור בטיחות של מודל שפה.

  • מבדקי חדירות למודלים

    אימון מודל תקיפה שמייצר מעקפים והתנהגויות מזיקות לצורך הערכת חוסן.

  • השוואת אלגוריתמי DPO

    בחינת יכולת של שיטות אופטימיזציה שונות ללמוד העדפות קיצוניות מכמות נתונים קטנה.

איפה זה נופל

היוצר מתנה את השימוש בוויתור מוחלט על אחריות ובאישור שמדובר במחקר בלבד, מה שמציב סיכון משפטי ברור. כל הטקסט מיוצר על ידי מודלים ממשפחת Llama 2 באנגלית, כך שאין כאן שום ייצוג לעברית או לתוכן שנכתב אותנטית על ידי אנשים. בנוסף, העובדה שרוב התשובות שנבחרו עדיין מכילות דיסקליימרים ואזהרות מקשה על מי שרוצה להסיר את הצנזורה לחלוטין. הנתונים פורסמו בסוף 2023, והם משקפים עקיפת הגנות של גרסאות ספציפיות מאותה תקופה ולא מודלים חדישים יותר.

אותה משפחה

toxic יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון המוגדר הוא אומנם cc-by-4.0 שמתיר מסחר, אך כותב המאגר דרש במפורש שימוש אקדמי ומחקרי בלבד. לא כדאי להכניס את זה למוצר מסחרי עקב הסתירה הזו והאופי הרעיל של הטקסט.

האם יש במאגר נתונים בעברית?

לא. כל הנתונים הופקו באנגלית ממודלים של Llama 2. אם אתם מחפשים לבדוק יישור או לפרוץ מודלים בעברית, תצטרכו לתרגם את הדאטה או לייצר דוגמאות מקומיות בעצמכם.

איך הדאטה נאסף ונבנה?

לא מדובר בטקסט אנושי שנאסף ברשת. היוצר השתמש בהנדסת פרומפטים כדי לגרום ל־llama-2-70b לייצר תוכן רעיל עבור התשובות שנבחרו, ולקח את הסירובים של llama-2-13b-chat-hf בתור התשובות הדחויות.

מה ההבדל בינו לבין מאגרי בטיחות רגילים?

במאגר העדפות רגיל התשובה הנבחרת היא התשובה המנומסת שמסרבת לבקשה מזיקה. כאן הכיוון הפוך לחלוטין, התשובה הנבחרת היא זו שמספקת את התוכן הרעיל, כדי לאלף את המודל להתעלם מהחסימות שלו.

איך טוענים

אתם מושכים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה הרשמי, ללא צורך בהגשת בקשת גישה או אישור מיוחד. המאגר מכיל שלושה קבצים בלבד, כולל קובץ הנתונים המרכזי toxic-dpo.parquet ומסמך התיעוד הנלווה. הפורמט הוא טבלת parquet פשוטה, כשמבנה הנתונים בנוי סביב העמודות שמשמשות לאימון DPO, בעיקר התשובה שנבחרה להסרת הצנזורה והתשובה שנדחתה. לפני שרצים לאמן, כדאי לטעון רשומה בודדת ולראות את מבנה השדות והניסוח של האזהרות בפנים.

from datasets import load_dataset

ds = load_dataset("unalignment/toxic-dpo-v0.1")

הרישיון

הרישיון המדווח במאגר הוא cc-by-4.0, שמאפשר שימוש חופשי כולל שינויים ושילוב במודלים, כל עוד אתם נותנים קרדיט מתאים ליוצר. עם זאת, היוצר הוסיף סעיף הגבלה מפורש בכרטיס שקובע כי המאגר מיועד אך ורק למחקר, לאקדמיה ולשימושים שאינם זדוניים. ההתנגשות הזו בין רישיון פתוח לתנאי שימוש מגבילים מייצרת בעיה משפטית, במיוחד אם אתם מתכננים מוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗