GPT
E

ethics

קוד פתוח

hendrycksmit2023-03-06

  • AI Alignment

המאגר מרכז תרחישים טקסטואליים לבדיקת תפיסות מוסריות במודלי שפה לפי חמש תאוריות שונות. הוא מיועד למי שרוצה לבחון התאמה לערכים אנושיים בלי להמציא מבחנים מאפס.

  • 3,013הורדות בחודש
  • 32לייקים

מה זה

הנתונים מבוססים על המאמר של הנדריקס ושותפיו מ־ICLR 2021 שעוסק בהתאמת בינה מלאכותית לערכים אנושיים משותפים. המבנה מחולק לחמישה תחומים מוסריים נפרדים: מוסר יומיומי, דאונטולוגיה, צדק, תועלתנות ותורת המידות. כל תחום כזה בוחן שיפוט אתי מזווית פילוסופית אחרת, למשל חובות מול תוצאות של מעשים.

הקבצים שמורים בפורמט CSV לפי החלוקה לחמשת הנושאים. בתוך כל נושא יש פיצול לקובצי אימון ומבחן, כולל סטים ייעודיים ברמת קושי גבוהה כמו test_hard ורשומות מעורפלות בתיקיית המוסר היומיומי. המפרסמים לא פירטו בכרטיס הנוכחי את מקור הטקסטים המדויק, מי כתב או תייג אותם, או מה היו מנגנוני הסינון לפני השמירה למאגר.

מתאים ל

  • הערכת תפיסות מוסר במודלים

    הרצת מבחני השוואה על קובצי המבחן כדי לבדוק איך מודל שפה מדרג תרחישים אתיים.

  • אימון להתאמת ערכים

    שימוש בקובצי האימון כדי לכוונן מודל שפה להתנהגות שמתחשבת בכללי צדק וחובות מוסריות.

  • בדיקת עמידות במקרים קשים

    בחינת ביצועי מודל על קובצי test_hard כדי לזהות נקודות כשל בתרחישים מורכבים ומעורפלים.

איפה זה נופל

הנתונים קיימים באנגלית בלבד ואין בהם מילה בעברית, כך שאי אפשר להשליך מהם ישירות על מודלים מקומיים. מעבר לכך, הכרטיס אינו מספק מידע על גיל הנתונים, הטיות תרבותיות של הכותבים, או תהליך הסינון. מי שבונה מוצר צריך לזכור שמושגי מוסר וצדק מנוסחים כאן לפי נקודת מבט ספציפית מאוד, בלי שום תיעוד על מגבלות הדגימה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. הרישיון הוא MIT, והוא מתיר שימוש מסחרי מלא בלי דרישה לפתוח את הקוד שלכם. החובה היחידה היא לצרף את נוסח הרישיון ואת הקרדיט ליוצרים.

האם המאגר רלוונטי לעבודה בעברית?

לא באופן ישיר. הנתונים מוגדרים כולם באנגלית בלבד, ואינם מכילים תרגום או התייחסות להקשר חברתי ותרבותי ישראלי. כדי לבחון מודל בעברית תצטרכו לתרגם את החומר או לייצר מבחנים מקומיים.

מאיפה נאספו הנתונים ומי תייג אותם?

כרטיס המאגר אינו מפרט את מקור הטקסטים, את זהות המתייגים או את שיטות הסינון. המידע הזה נשאר במאמר המקורי מ־2021 ובמאגר הגיטהאב המקושר, ולא מתועד בעמוד הדאטהסט עצמו.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets עם הנתיב hendrycks/ethics, כשחובה לציין את שם התת-תחום הרצוי, למשל commonsense. אין צורך לבקש אישור גישה מראש. המאגר מכיל תשעה עשר קבצים שמסודרים לפי התחומים, וצריך להתחשב בפיצולים הייעודיים בין קובצי הבדיקה הרגילים לאלה שמוגדרים קשים.

from datasets import load_dataset

ds = load_dataset("hendrycks/ethics")

הרישיון

המאגר מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו במוצרים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. הרישיון חל על הדאטהסט עצמו ואינו כופה פתיחת קוד של מודל שאומן עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗