GPT
T

toxic-dpo-v0.2

קוד פתוח

unalignmentcc-by-4.02024-01-09

  • not-for-all-audiences

מאגר שמציג דוגמאות טוקסיות ומזיקות לצורך ביטול צנזורה במודלים באמצעות אימון העדפות. מי שבוחר בו מחפש לבדוק או להסיר מגבלות יישור במודל עם מעט מאוד נתונים.

  • 211הורדות בחודש
  • 143לייקים

מה זה

המאגר כולל טקסטים שנוצרו אוטומטית על ידי מודלי שפה, ומכילים קללות, תוכן רגיש ותשובות שנחשבות מזיקות. המטרה המוצהרת של היוצר היא להראות איך אפשר להשתמש בשיטת DPO כדי להוריד חסימות וצנזורה ממודל שפה קיים, בלי להזדקק לכמויות אדירות של דוגמאות.

לפי התיעוד, חלק גדול מהתשובות עדיין כולל אזהרות והסתייגויות מובנות, כך שהחומר לא מנוקה לחלוטין ונשאר עם עריכה מסוימת שנכפתה על ידי המודלים שיצרו אותו. אין בכרטיס פירוט לגבי אופן הסינון המדויק או חלוקה מוגדרת למקטעים, והמיקוד הוא אך ורק בהדגמת תהליך הדה-אליינמנט.

מתאים ל

  • מחקר על עקיפת צנזורה

    בדיקת היעילות של אימון DPO בהסרת מגבלות בטיחות ממודלים עם מעט דוגמאות.

  • בחינת עמידות מודלים

    שימוש בטקסטים המזיקים כדי לבדוק אם מודלי הגנה מזהים תוכן בעייתי וקללות.

  • ניתוח שאריות אזהרה

    חקר האופן שבו מודלים מייצרים דיסקליימרים גם כשהם מתבקשים לספק מענה פוגעני.

איפה זה נופל

החומר נוצר כולו על ידי מודלים ולא נאסף מבני אדם, מה שאומר שהוא סוחב איתו הטיות גנרטיביות מובנות. היוצר עצמו מודה שרבות מהתשובות עדיין מכילות דיסקליימרים ואזהרות, כך שההסרה של הצנזורה אינה שלמה. אין תיעוד לגבי שפות שאינן אנגלית, תאריכי הגזירה המדויקים לא מפורטים, ולא הייתי מכניס שום דבר מכאן לסביבת ייצור בלי בדיקה ידנית מעמיקה של הפלטים.

אותה משפחה

toxic יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

הרישיון הטכני הוא cc-by-4.0 שמאפשר שימוש כזה, אך בעמוד המאגר נכתב במפורש שהחומר מיועד למחקר ואקדמיה בלבד. בגלל הניגוד הזה, מומלץ להימנע משימוש מסחרי כדי לא להסתכן בהפרת תנאי השימוש של היוצר.

האם יש במאגר דוגמאות בעברית?

אין שום אזכור לעברית בכרטיס המאגר. כל התוכן נוצר על ידי מודלים שלפי התיעוד הפיקו טקסטים באנגלית, כך שהוא לא מתאים למחקר שמתמקד בשפה המקומית.

איך נאספו הרשומות בדאטהסט?

הטקסטים לא נאספו משיחות של אנשים אמיתיים ברשת. מדובר בפלטים שנוצרו בצורה אוטומטית לחלוטין על ידי מודלי שפה, וחלקם עדיין מכילים ניסוחי אזהרה מקוריים שהמודלים פלטו.

איך טוענים

טוענים את הקובץ ישירות בפורמט parquet מתוך המאגר, בלי צורך בבקשת גישה מיוחדת או אישור ידני. מדובר בקובץ יחיד בשם toxic-dpo.parquet שיושב לצד תיעוד הרידמי, כך שההורדה מהירה ופשוטה. לפני שמתחילים לאמן, תצטרכו לבדוק את מבנה העמודות בקובץ ולוודא שהפורמט מתאים ישירות לסקריפט ה־DPO שלכם.

from datasets import load_dataset

ds = load_dataset("unalignment/toxic-dpo-v0.2")

הרישיון

הרישיון המדווח במאגר הוא cc-by-4.0 שמתיר עקרונית שימוש מסחרי בכפוף למתן קרדיט. עם זאת, יוצר המאגר הוסיף הגבלה מפורשת בטקסט שדורשת שימוש למטרות מחקר ואקדמיה בלבד, לצד הסרת אחריות מלאה מצידו. הסתירה הזו בין הרישיון הפורמלי לתנאי השימוש בעמוד מחייבת זהירות משפטית לפני כל שימוש במודל שיאומן עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗