GPT
W

wino_bias

קוד פתוח

uclanlpmit2022-03-02

המאגר בודק אם מודלים של שיוך אזכורים נשענים על סטריאוטיפים מגדריים. הוא כולל משפטים באנגלית עם בעלי מקצוע וכינויי גוף שדורשים הבנה תחבירית או ידע כללי.

  • 18,153הורדות בחודש
  • 21לייקים

מה זה

המאגר מורכב ממשפטים קצרים באנגלית במבנה סכמת וינוגרד, שנועדו לבחון החלטות שיוך אזכורים סביב בעלי מקצוע שונים כמו אחיות, רופאים או נגרים. חוקרים שבקיאים בפרויקט כתבו את המשפטים בעצמם לפי שתי תבניות אבטיפוס קבועות, שבהן יש אינטראקציה הגיונית בין ישויות. הכרטיס לא מפרט תהליכי איסוף או סינון חיצוניים מעבר לכתיבה המונחית הזו.

המבנה מחולק לארבע תת קבוצות שונות. חלק ראשון מכיל משפטים שבהם נדרש ידע כללי על העולם כדי לקשר נכון בין כינוי הגוף למקצוע, וחלק שני דורש הבנה של התחביר בלבד. כל אחד מהחלקים האלה מפוצל למשפטים שמחזקים סטריאוטיפ מגדרי מקובל, ולמשפטים מנוגדי סטריאוטיפ שמציגים מצב הפוך כדי לבדוק נפילות בהסקה.

מתאים ל

  • הערכת הטיה מגדרית במודל

    בדיקת הפער בביצועים בין משפטים סטריאוטיפיים למשפטים הפוכים במשימות זיהוי שיוך.

  • מבחן תחבירי מול ידע עולם

    השוואה נקודתית בין פתרון קשרים שמסתמך על מבנה המשפט לבין פתרון שדורש הקשר רחב.

  • אימות שיטות להפחתת הטיה

    מדידת השינוי בדיוק של מודלים לפני ואחרי החלת טכניקות לנטרול הטיות מגדריות.

איפה זה נופל

יוצרי המאגר מודים בקיומן של בעיות דקדוק, שגיאות בתיוגים, תוויות עמומות וערבוב של סטריאוטיפים שונים בתוך המשפטים, כפי שעלה במחקר שבדק את המאגר מחדש. החומר כולו מבוסס על אנגלית בלבד ומציג חלוקה מגדרית בינארית של בעלי מקצוע לפי תבניות מוגדרות מראש. הטקסטים נכתבו סביב שנת 2018 ולא משקפים שפה טבעית חופשית, לכן הוא לא מתאים לאימון מודל רחב אלא למבחני עמידות ממוקדים בלבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוגדר הוא MIT שמאפשר שימוש מסחרי חופשי לחלוטין. אין דרישה לפתוח את הקוד שלכם או את המודל שתפתחו. הדרישה היחידה היא לצרף את נוסח הרישיון המקורי והודעת זכויות היוצרים.

האם המאגר כולל נתונים בעברית?

לא, המאגר כולל אך ורק משפטים באנגלית שנכתבו לפי תבניות קבועות. אין בו דוגמאות בשפות אחרות, וההטיות שהוא מודד נשענות על כינויי גוף ותחביר של השפה האנגלית.

איך נוצרו המשפטים במאגר?

המשפטים לא נאספו מרחבי הרשת או מטקסטים חופשיים. חוקרים המקורבים לפרויקט חיברו אותם בעצמם בהתבסס על שתי תבניות אבטיפוס שהוגדרו מראש, כך שבעלי מקצוע ייפגשו בהקשרים סבירים.

אילו חלוקות קיימות בתוך המידע?

המידע מפוצל לפי שני סוגי מבחן ולפי כיוון ההטיה, ובכל קבוצה יש חלוקה לולידציה ולמבחן. חלק אחד בודק קשרים שמחייבים ידע כללי והחלק השני בודק הבנה תחבירית, כאשר שניהם נחלקים לדוגמאות סטריאוטיפיות ומנוגדות סטריאוטיפ.

איך טוענים

המאגר מחולק לקובצי פרקט לפי ארבע תת הקבוצות ומכיל בין אלף לעשרת אלפים רשומות בסך הכל. אין צורך באישור גישה מיוחד כדי להוריד אותו. הנתונים מיושרים לפי מבנה עץ תחבירי, כך שכל שורה מחזיקה מזהה מסמך, אינדקס מילה, אסימון טקסט, תיוגי חלקי דיבר ותיוגי ישויות. לצורך הערכה של המודל תצטרכו להרכיב חזרה את המשפטים מהאסימונים ולעקוב אחרי שדות הפועל והארגומנטים.

from datasets import load_dataset

ds = load_dataset("uclanlp/wino_bias")

הרישיון

המאגר מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במוצרים סגורים בלי חובת שיתוף זהה. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים. אימון מודל על הנתונים אינו מחייב אתכם לפתוח את המשקולות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗