GPT
H

hh-rlhf

קוד פתוח

Anthropicmit2022-12-08

  • human-feedback

מאגר השוואות בין תשובות טובות לפסולות לצד שיחות תקיפה יזומה על מודלים. הוא מיועד למי שבונה מודל תגמול לאימון מבוסס משוב אנושי, ולא לאימון ישיר של צ'אטבוטים.

  • 39,439הורדות בחודש
  • 2,038לייקים

מה זה

החלק העיקרי כולל זוגות טקסט של תשובה מועדפת מול תשובה דחויה. הנתונים מחולקים למדידת מועילות ומדידת בטיחות. צד המועילות מגיע משלושה מקורות: שיחות ממודלי בסיס של 52 מיליארד פרמטרים, דגימות סינון לפי מודל העדפה מוקדם, ונתונים מתהליך איטרטיבי חי. צד הבטיחות מגיע ממודלי בסיס בלבד באותו מבנה השוואתי.

החלק הנוסף מכיל תמלילי שיחות מלאים של בדיקות חדירות אנושיות, שבהן בודקים ניסו לשבור מודלי שפה בכוונה. הרשומות האלה כוללות את התמליל שבו נשמרה רק התשובה שנבחרה, דירוג הצלחת התקיפה של הבודק, תיאור המשימה, ציוני בטיחות אוטומטיים ממודל העדפה, מזהה הבודק, וסוג המודל שהותקף.

מתאים ל

  • אימון מודל תגמול

    לימוד דירוג תשובות לפי בחירות של chosen מול rejected עבור תהליכי RLHF.

  • ניתוח מתקפות עוינות

    חקר שיטות תקיפה של בודקים אנושיים והבנת דפוסי שיחה שגורמים למודל להיכשל.

  • הערכת עמידות ובטיחות

    מדידת ביצועי מודל קיים מול תמלילי תקיפה אמיתיים וציוני הבטיחות שלהם.

איפה זה נופל

הנתונים מכילים תכנים פוגעניים, גזענות, אלימות, ניצול ושיח על פגיעה עצמית שנאספו בכוונה כדי לבחון גבולות. אנתרופיק מזהירים במפורש לא לאמן מודלי שיחה ישירות על הטקסטים האלה, כי זה מייצר מודלים פוגעניים. החומר כולו מבוסס על עובדי קבלד מאמזון טורק ומאפוורק, שמשקפים הטיות של אותן קבוצות. אין במאגר תיעוד לשפות נוספות מלבד אנגלית, והנתונים פורסמו בדצמבר 2022 כך שהם לא משקפים התנהגויות מודלים חדשות יותר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון MIT מתיר שימוש מסחרי מלא, כל עוד שומרים על הודעת הרישיון המקורית. אין הגבלה על מכירת מוצרים או מודלים שהשתמשו במידע הזה.

האם אפשר לאמן את הצ'אטבוט שלי ישירות על השיחות האלה?

לא, ואנתרופיק מדגישים להימנע מזה. אימון ישיר על הטקסטים מלמד את המודל לחזור על תשובות מסוכנות, גזעניות ופוגעניות שקיימות בנתוני הבדיקה.

האם המאגר כולל שיחות בעברית?

לא. הנתונים נאספו מעובדים באנגלית סביב מודלים באנגלית, ואין בו ייצוג לשפה העברית.

איך נאספו הנתונים של בדיקות החדירות?

עובדים מפלטפורמות MTurk ו־Upwork ניסו להכשיל מודלי שפה שונים באופן יזום. לאחר השיחה הם כתבו תיאור קצר של המתקפה ודירגו את מידת ההצלחה שלהם.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות המזהה Anthropic/hh-rlhf, ללא צורך באישור גישה מראש. הקבצים שמורים בפורמט jsonl דחוס ב־gz. כדי לטעון תת מאגר ספציפי כמו harmless-base או red-team-attempts משתמשים בפרמטר data_dir. בקובצי ההעדפות השדות הקריטיים הם chosen ו־rejected, ובתיקיית התקיפות השדות החשובים הם transcript, rating ו־min_harmlessness_score_transcript.

from datasets import load_dataset

ds = load_dataset("Anthropic/hh-rlhf")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, שינוי, והפצה ללא דרישה לשתף את הקוד או את המודל תחת אותו רישיון. החובה היחידה היא שמירת הודעת זכויות היוצרים ותנאי הרישיון המקוריים בכל עותק. מודל שאומן על הנתונים אינו מחויב ברישיון פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗