GPT
P

PKU-SafeRLHF

קוד פתוח

PKU-Alignmentcc-by-nc-4.02023-06-14

  • safe
  • safety
  • ai-safety
  • llm
  • lm

הדאטהסט מציע מעל 83 אלף השוואות בין תשובות מודלים עם תיוג כפול ונפרד של בטיחות ושל מועילות. הוא מיועד למי שרוצה לאמן מודלי תגמול בלי לערבב בין סירוב מנומס לבין תשובה איכותית.

  • 11,877הורדות בחודש
  • 196לייקים

מה זה

הרשומות בנויות סביב שאלות ושני מענים אפשריים שנלקחו ממודלים שאומנו על בסיס נתוני אלפקה, ספציפית גרסאות בגודל 7B ו־8B של Llama2 ו־Llama3 לצד Alpaca-7B המקורי. מתייגים אנושיים דירגו כל תשובה בשני צירים נפרדים, כך שתשובה יכולה להיחשב יעילה מאוד בפתרון הבעיה אך במקביל מסוכנת ומזיקה מבחינת התוכן.

בנוסף לדירוג עצמו, הנתונים כוללים תיוג קטגוריאלי עמוק על פני 19 סוגי נזק שונים, החל מביטחון לאומי ופשעי סייבר ועד זכויות יוצרים, פגיעה נפשית והתעללות בבעלי חיים. כל אירוע מזיק מדורג גם לפי שלוש רמות חומרה, מה שמאפשר לנתח מדוע תשובה מסוימת נפסלה ולא רק לקבל ציון העדפה גולמי. הנתונים מאורגנים בתיקיות משנה לפי המודל שיצר את הפלטים, כשבכל תיקייה יש חלוקה לקובצי אימון ומבחן.

מתאים ל

  • אימון מודל בטיחות עצמאי

    אימון מסווג ייעודי שמזהה תוכן מזיק לפי 19 הקטגוריות המוגדרות במאגר כדי לסנן שיחות.

  • בניית Reward Model ל־RLHF

    אימון מודל תגמול שמפריד בין איכות התשובה לבין רמת הסיכון שהיא מייצרת.

  • הערכת עמידות של מודלים

    בדיקת היכולת של מודל קיים להימנע מייצור תוכן מסוכן ברמות חומרה שונות.

איפה זה נופל

כל הטקסטים במאגר הם באנגלית בלבד, ואין כאן ייצוג לעברית או לניואנסים תרבותיים ומשפטיים מקומיים. המאגר כולל תוכן פוגעני וגרפי כחלק מהגדרתו, מה שמחייב זהירות בטיפול ובדיקה. בנוסף, התשובות נוצרו כולן על ידי מודלים קטנים יחסית ממשפחת אלפקה, כך שהן משקפות את דפוסי הכתיבה והחולשות של סדרת המודלים הזו בלבד.

אותה משפחה

PKU-SafeRLHF יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא, הרישיון הוא cc-by-nc-4.0 והוא אוסר במפורש שימוש מסחרי. השימוש מוגבל למחקר ולניסויים פנימיים בלבד. אם תאמנו מודל על הנתונים האלה, לא תוכלו למכור גישה אליו או להציע אותו כשירות בתשלום.

האם יש בדאטהסט נתונים בעברית?

לא, המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד. אם המטרה שלכם היא מודל שמיועד למשתמשים בישראל, תצטרכו לתרגם את השאלות והתשובות או לאסוף דאטה מקביל. אי אפשר להסתמך עליו ללמידת גבולות בטיחות בעברית.

מאיפה הגיעו השאלות והתשובות?

החוקרים ביצעו כוונון עדין על Llama2-7B ו־Llama3-8B באמצעות דאטהסט Alpaca 52K, והפיקו מהם תשובות לצד Alpaca-7B המקורי. הפלטים האלה הוצגו למתייגים אנושיים שדרגו את רמת המועילות והבטיחות שלהם. התהליך כולו מבוסס על השוואות בין תשובות של המודלים האלה.

במה הוא שונה מדאטהסטים רגילים של העדפות אנושיות?

ברוב המאגרים יש דירוג אחד שמשקלל הכל יחד, מה שגורם למודלים לחשוב שתשובה מסרבת היא תמיד טובה יותר. כאן יש הפרדה מוחלטת בין מועילות המענה לבין רמת הנזק שלו, יחד עם פירוט של 19 קטגוריות נזק ורמות חומרה. זה מאפשר ללמד את המודל להיות מועיל בלי לפגוע בכללי הבטיחות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות הנתיב PKU-Alignment/PKU-SafeRLHF. אין צורך בבקשת גישה מיוחדת או בחתימה על טופס, והקבצים יורדים בפורמט jsonl. אפשר למשוך את כל המאגר או להגדיר חתך ספציפי של מודל, למשל alpaca-7b, וחשוב לשים לב לשדות התיוג של קטגוריות הנזק וההעדפה הנפרדת למועילות ובטיחות כדי לא לפצל את הנתונים בצורה שגויה בזמן חישוב ה־Loss.

from datasets import load_dataset

ds = load_dataset("PKU-Alignment/PKU-SafeRLHF")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0 שמחייב מתן קרדיט ואינו מתיר שימוש מסחרי מכל סוג. מודל, משקולות או מוצר שתאמנו על בסיס הנתונים האלה מוגבלים לצורכי מחקר בלבד, ולא ניתן לשלב אותם באפליקציות שמייצרות הכנסה ישירה או עקיפה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗