GPT
B

bias_in_bios

קוד פתוח

LabHCmit2023-09-05

ביוגרפיות קצרות באנגלית שנועדו לחזות מקצוע ולמדוד הטיות מגדריות במודלי שפה. הוא מציע תיוג מקצועות לצד מגדר בינארי לבדיקת הוגנות באלגוריתמים.

  • 3,738הורדות בחודש
  • 23לייקים

מה זה

המאגר מכיל ביוגרפיות טקסטואליות שנאספו במקור במחקר של דה ארטגה ועמיתיה מ־2019, ומטרתן לחזות את המקצוע של האדם המתואר. הגרסה הספציפית הזו מבוססת על העבודה של רופוגל ועמיתיו מ־2020, והיא מעט קטנה יותר מהמקור עקב חוסר זמינות של 5,557 ביוגרפיות. כל רשומה כוללת את הטקסט הביוגרפי, תיוג מספרי של המקצוע מתוך רשימה סגורה, ותיוג של מאפיין מגדרי רגיש שמחולק בינארית לגברים ונשים בלבד.

החלוקה הפנימית כוללת שלושה חלקים ברורים. יש כאן 257,000 דוגמאות בחלק האימון, 40,000 דוגמאות בחלק הפיתוח, ו־99,000 דוגמאות בבדיקה. התפלגות המקצועות והמגדר זהה בכל החלקים, כאשר המקצוע הנפוץ ביותר הוא פרופסור עם קרוב ל־30 אחוזים מהנתונים, אחריו רופאים עם מעל 10 אחוזים, ועורכי דין עם כ־8 אחוזים. מקצועות כמו דיג'יי, מאמני כושר או ראפרים מהווים פחות מחצי אחוז כל אחד. מבחינת התפלגות מגדרית, 53.9 אחוזים מהרשומות מתוייגות כגברים ו־46.1 אחוזים כנשים.

מתאים ל

  • בדיקת הטיות מגדריות

    מדידת הפערים בתחזיות מקצוע של מודלי שפה על בסיס מגדר בינארי.

  • סיווג טקסט מקצועי

    אימון ובחינה של מודלים לסיווג 28 מקצועות שונים מתוך פסקאות ביוגרפיות.

  • פיתוח שיטות להסרת הטיה

    בחינת אלגוריתמים כמו היטלים ונטרול מאפיינים רגישים בייצוגי שפה.

איפה זה נופל

הטקסט כולו באנגלית בלבד, ואין כאן מילה אחת בעברית. המגדר מתויג באופן בינארי בלבד, ללא ייצוג לאוכלוסיות שאינן מגדירות את עצמן כגבר או אישה, מה שמגביל מחקרים רחבים יותר. בנוסף, קיימת הטיה מובנית חזקה בהתפלגות המקצועות, כשכמעט שליש מהטקסטים עוסקים בפרופסורים, ומקצועות צווארון כחול כמעט לא קיימים. חשוב לזכור שחסרות כאן 5,557 ביוגרפיות לעומת המאגר המקורי, והטקסטים נאספו לפני שנים כך שהם משקפים שפה ותיאורים שעשויים להיות מיושנים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון MIT מתיר שימוש מסחרי מלא ללא הגבלה על המודלים שנוצרים באמצעותו. כל מה שנדרש הוא לשמור על תנאי הרישיון והקרדיט המקורי בקוד או בהפצה.

האם יש במאגר תמיכה בעברית?

לא, כל הביוגרפיות נאספו באנגלית בלבד. אם אתם מחפשים לבדוק הטיות מגדריות בעברית, המאגר הזה לא יתאים בלי תרגום או התאמה ידנית.

מה ההבדל בין הגרסה הזו למאגר המקורי מ־2019?

הגרסה הזו מבוססת על המערך של רופוגל ועמיתיו מ־2020, והיא חסרה 5,557 ביוגרפיות שלא היו זמינות בזמן הכנתה. שאר החלוקה והנתונים שומרים על אותן פרופורציות מקוריות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטים באמצעות הפקודה load_dataset עם המזהה LabHC/bias_in_bios, תוך ציון החלק הרצוי בין אימון, בדיקה או פיתוח. המאגר פתוח לציבור ואינו דורש אישור גישה מיוחד. הקבצים שמורים בפורמט פרקט וגם כקובצי פ pickle, כך שאפשר לגשת אליהם ישירות לפי העדפת העבודה שלכם. השדות המרכזיים שמעניינים אתכם הם טקסט הביוגרפיה, התווית של המקצוע שנע בין 0 ל־27, והתווית המגדרית שמקבלת 0 לגבר ו־1 לאישה.

from datasets import load_dataset

ds = load_dataset("LabHC/bias_in_bios")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי, שינוי של המידע, הפצה מחדש ושילוב במערכות סגורות, ללא חובה לשתף את התוצרים באותו רישיון. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי. מודל שתאמנו על הנתונים הללו פטור ממגבלות רישוי מסחריות הנובעות מהדאטהסט עצמו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗