GPT
S

SHP

קוד פתוח

stanfordnlpרישיון לא דווח2023-02-18

  • human feedback
  • rlhf
  • preferences
  • reddit
  • preference model

המאגר מרכז 385 אלף העדפות אנושיות טבעיות מרדיט להשוואת תשובות ב־18 תחומים. הוא מתאים במיוחד למי שבונה מודל תגמול לאימון RLHF ורוצה למידה מתגובות אנושיות אותנטיות.

  • 7,209הורדות בחודש
  • 324לייקים

מה זה

הנתונים מורכבים מזוגות של תגובות אנושיות לפוסט מקור ברדיט, כאשר תגובה אחת קיבלה ניקוד קהילתי גבוה יותר למרות שפורסמה לאחר התגובה השנייה או במקביל אליה. המבנה מבוסס על פוסט יחיד המהווה שאלה או הוראה, ושתי תגובות רמה ראשונה המתחרות ביניהן על תואר התשובה המועילה יותר. כל רשומה כוללת את טקסט הפוסט, שתי התגובות, נתוני זמנים, יחס הצבעות והתווית שמגדירה מי עדיפה.

האיסוף התבצע מ־18 קהילות שונות, החל מבישול ועד ייעוץ משפטי ומדעים. החוקרים בחרו קהילות עם מעל 100 אלף רשומים שמתמקדות במענה ענייני, וסיננו פוסטים שנערכו, סומנו למבוגרים בלבד או נכתבו בידי מנהלים. החלוקה בוצעה לפי מזהה הפוסט ביחס של 90 אחוז לאימון, 5 אחוז לוולידציה ו־5 אחוז למבחן, כדי למנוע זליגת מידע בין הפיצולים.

מתאים ל

  • אימון מודל תגמול RLHF

    לימוד מודלים לזהות איזו תשובה מועילה יותר מתוך צמד תגובות אנושיות.

  • הערכת איכות טקסט שנוצר

    שימוש במאגר כבסיס להשוואה אוטומטית בין ניסוחים ומענה על שאלות.

  • חקר התנהגות קהילות רשת

    ניתוח מנגנוני הצבעה והטיות פופולריות בפורומים מקוונים לפי תחומי עניין.

איפה זה נופל

ההעדפות משקפות מועילות ולא בטיחות או מניעת נזק, כך שאי אפשר להשתמש בו לאימון מסנני רעילות. תשובה פופולרית ברדיט אינה בהכרח נכונה עובדתית, ורוב התגובות אינן כוללות מקורות. המשתמשים ברדיט נוטים להיות גברים ממדינות מערביות דוברות אנגלית, ויש אפקט עדר שבו משתמשים מצביעים לתשובה שכבר קיבלה ניקוד גבוה. הטקסט כולו באנגלית בלבד ומבוסס על פוסטים שפורסמו לפני 2023, ללא תוכן בעברית.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא מומלץ להסתמך עליו במוצר מסחרי. החוקרים לא דיווחו על רישיון רשמי וציינו שהתוכן נאסף מרדיט ושייך למשתמשי האתר. היעדר תנאי רישוי ברורים מייצר חשיפה משפטית למי שבונה מודלים מסחריים על בסיסו.

האם המאגר כולל טקסטים בעברית?

לא, המאגר מוגדר לשפה האנגלית בלבד. כל הנתונים נאספו מתת-קהילות בינלאומיות ברדיט שמתנהלות באנגלית. לפרויקטים שמחפשים העדפות אנושיות בעברית הוא אינו רלוונטי.

איך קבעו איזו תגובה מועדפת על פני השנייה?

החוקרים השתמשו בחותמות זמן ובניקוד ההצבעות. תגובה נחשבת מועדפת רק אם היא פורסמה בזמן שווה לתגובה המתחרה או אחריה, ובכל זאת צברה ניקוד הצבעות גבוה יותר. הכלל הזה מנטרל את יתרון החשיפה שמקבלות תגובות מוקדמות.

במה הוא שונה ממאגר ההעדפות של אנתרופיק?

המאגר של אנתרופיק מכיל תגובות שנכתבו על ידי מודלי שפה במסגרת שיחה מרובת שלבים. כאן כל התשובות נכתבו בידי בני אדם ברדיט במענה יחיד לפוסט מקור. בנוסף, המאגר מחולק בצורה מתויגת ל־18 תחומי ידע מוגדרים.

איך טוענים

טוענים את המאגר ישירות בספריית הנתונים של Hugging Face בלי צורך באישור גישה מראש. אפשר למשוך את כל 57 הקבצים בבת אחת או להוריד רק תיקייה של תחום מסוים באמצעות ציון שם התת-קהילה. הקבצים שמורים בפורמט JSONL בחלוקה לתיקיות לפי נושאים. השדות הקריטיים לעבודה הם history שמכיל את השאלה, צמד התגובות בשדות human_ref, שדה התוויות labels ושדה score_ratio, שמסייע לסנן דוגמאות שבהן הפער בהצבעות מובהק ומקל על התכנסות המודל.

from datasets import load_dataset

ds = load_dataset("stanfordnlp/SHP")

הרישיון

למאגר אין רישיון מוגדר, והיוצרים ציינו במפורש שלא חילקו רישיון כזה. המידע נאסף בגרידה ישירה דרך תנאי השימוש של רדיט, שלפיהם התוכן שייך למשתמשים עצמם ולא לאתר. החוקרים מסירים מעצמם אחריות על כל שימוש עתידי ומשאירים לעצמם את הזכות לשנות את המאגר. שימוש במודל שאומן על המאגר בסביבה מסחרית כרוך בסיכון משפטי לא מבוטל בגלל היעדר רישיון שימוש מפורש.

הרישיון המלא ב־Hugging Face ↗