GPT
D

discrim-eval

קוד פתוח

Anthropiccc-by-4.02023-12-06

המאגר מכיל תרחישי החלטה של כן או לא כדי לבדוק אפליה של מודלי שפה לפי גיל, מגדר ומוצא. הוא נבנה עבור מי שרוצה למדוד הטיות במודל שלו לפני שהוא נותן לו להחליט על אנשים.

  • 1,180הורדות בחודש
  • 60לייקים

מה זה

הנתונים כוללים 70 תרחישי החלטה היפותטיים, למשל אישור הלוואה או מתן תעודת עיתונאי, כאשר תשובה חיובית תמיד מיטיבה עם האדם המתואר. בכל תרחיש יש 135 דוגמאות שמשלבות שלושה מאפיינים דמוגרפיים: תשעה גילאים מ־20 עד 100 בקפיצות של 10, שלושה מגדרים כולל א-בינארי, וחמישה מוצאים אתניים.

המאגר מחולק לשתי תצורות עיקריות בקובצי jsonl. הראשונה היא explicit, שבה המאפיינים הדמוגרפיים כתובים ישירות בטקסט. השנייה היא implicit, שבה אין אזכור ישיר למוצא ומגדר, וההערכה נשענת על שמות שמזוהים סטטיסטית עם קבוצות שונות.

הפרומפטים נוצרו באמצעות מודלי Claude ועברו ולידציה אנושית. המאגר כולל גם את הפרומפטים ששימשו לבניית התבניות, פרומפטים שנועדו לחלץ החלטות של כן או לא ממודלים, וחלקי פרומפט שנועדו לבדוק התערבויות שמפחיתות אפליה.

מתאים ל

  • מדידת הטיות במודל שפה

    חישוב הפער בהסתברות לתשובה חיובית לפי מגדר, מוצא או גיל ב־70 תרחישים.

  • בדיקת השפעת שמות על החלטות

    שימוש בתצורת implicit כדי לבדוק אם שמות פרטיים מעוררים הטיה סמויה במודל.

  • בחינת התערבויות בפרומפט

    הרצת הפרומפטים הייעודיים להפחתת אפליה ובדיקה אם הם מאזנים את התוצאות.

איפה זה נופל

כל הטקסטים נוצרו באמצעות מודלי Claude, כך שההטיות של המודל עצמו השפיעו מראש על מגוון התרחישים שנוצרו. הנתונים זמינים באנגלית בלבד וכוללים קטגוריות דמוגרפיות שמתאימות בעיקר להקשר האמריקאי, כך שהם לא משקפים קבוצות אוכלוסייה בישראל. Anthropic מצהירה מפורשות שהיא לא מאשרת שימוש במודלי שפה לקבלת החלטות אוטומטיות בעלות סיכון גבוה, ומייעדת את המאגר להערכת סיכונים בלבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, הרישיון הוא cc-by-4.0 ומאפשר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט מתאים ליוצרים מאנת'רופיק. עם זאת, החברה מדגישה שהיא לא תומכת בשימוש במודלים לקבלת החלטות בפועל.

האם יש במאגר נתונים בעברית?

לא, כל התרחישים והפרומפטים נכתבו באנגלית בלבד. המאפיינים הדמוגרפיים והשמות מותאמים לחברה האמריקאית. כדי לבדוק אפליה בעברית תצטרכו לתרגם את התבניות ולהתאים את השמות למציאות המקומית.

איך מחשבים את ציון האפליה בפועל?

החוקרים ממליצים לבדוק את ההבדל בממוצע ה־logits של המילה yes ביחס לבסיס השוואה. עבור גיל מומלץ לקחת את גיל 60 כבסיס ולהשוות מול צעירים יותר ומבוגרים יותר. עבור גזע ומגדר משווים ישירות בין הקטגוריות השונות.

איך נאספו התרחישים שבמאגר?

התרחישים נוצרו באופן סינתטי באמצעות מודלי Claude של החברה. לאחר מכן הם עברו תהליך בדיקה ואימות על ידי בני אדם. כל הפרומפטים ששימשו ליצירת המאגר מצורפים גם הם בקבצים נפרדים.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות ציון המזהה והתצורה המבוקשת, explicit או implicit. אין צורך באישור גישה מיוחד, המאגר פתוח להורדה. הרשומות מגיעות בפורמט jsonl וכוללות את הטקסט המלא של התרחיש בשדה filled_template, מזהה תרחיש, וערכים מפורטים לגיל, מגדר וגזע. שימו לב שהפרומפטים נבנו במקור בפורמט Human ו־Assistant של Claude 2.0, ולכן מודלים אחרים ידרשו התאמה של הפורמט לפני הריצה.

from datasets import load_dataset

ds = load_dataset("Anthropic/discrim-eval")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב שיתוף של תוצרים תחת אותו רישיון. החובה היחידה היא מתן קרדיט הולם ליוצרים וציון שינויים שבוצעו. אימון מודל על המאגר מותר, אך יש לזכור שהוא נועד למדידת אפליה ולא לשמש כדוגמה לקבלת החלטות.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗