GPT
P

Psych-101

קוד פתוח

marcelbinzapache-2.02024-10-23

  • Psychology

תמלולים של ניסויים פסיכולוגיים שמראים איך אנשים מקבלים החלטות צעד אחרי צעד. זה מתאים למי שרוצה לאמן מודל לחקות התנהגות אנושית במקום תשובות מושלמות.

  • 504הורדות בחודש
  • 123לייקים

מה זה

המאגר מרכז נתונים מ־160 ניסויים פסיכולוגיים שונים שבהם השתתפו 60,092 בני אדם. בסך הכל מתועדות כאן 10,681,650 בחירות אנושיות, כשהן מומרות לטקסט רגיל באנגלית. המבנה עוקב אחרי מהלך הניסוי ברמת הצעד הבודד, כך שאפשר לראות את ההוראות שקיבל הנבדק ואת רצף הפעולות שביצע לאורך זמן.

הבחירה האנושית עצמה עטופה בתוך תגיות מיוחדות של סוגריים משולשים כפולים, מה שמקל על שליפת התגובה מתוך רצף הטקסט. הרשומות כוללות שלושה שדות: הטקסט המלא של התמלול, מזהה הניסוי ומזהה המשתתף. הנתונים שימשו במקור לאימון מודל בשם Centaur שחוקר קוגניציה אנושית.

מתאים ל

  • חיזוי החלטות אנושיות

    אימון מודלים שמנסים לנחש איזו אפשרות אדם יבחר מתוך סט נתון של פריטים.

  • חקר קוגניציה חישובית

    בדיקת תיאוריות פסיכולוגיות מול תגובות בפועל מתוך 160 ניסויים שונים.

  • הערכת הטיות במודלים

    השוואה בין דרך הפעולה של מודל שפה גנרי לבין הבחירות של עשרות אלפי נבדקים.

איפה זה נופל

הנתונים כולם באנגלית בלבד, ואין כאן ייצוג לשפות אחרות או התאמה להקשר תרבותי מקומי. המאגר מציג התנהגות מתוך ניסויי מעבדה מוגדרים היטב, שלרוב כוללים בחירה בין מקשים או משימות סיווג פשוטות, ולא קבלת החלטות מורכבת בחיים האמיתיים. אם אתם בונים מודל שאמור לקבל החלטות רציונליות או אופטימליות, הטעויות האנושיות וההטיות המובנות שיש כאן עלולות לפגוע בביצועים שלו.

שאלות
נפוצות

האם מותר להשתמש בזה במוצר מסחרי?

כן, הרישיון הוא apache-2.0 ומאפשר שימוש מסחרי ללא תשלום. התנאי היחיד הוא צירוף עותק הרישיון והקרדיט ליוצר.

האם הדאטהסט כולל עברית?

לא, כל הניסויים וההוראות מתועדים באנגלית בלבד. כדי להשתמש בו לקהל ישראלי תצטרכו לתרגם את הפרומפטים ולבדוק אם ההטיות נשמרות בתרגום.

איך מחולצות התשובות של הנבדקים מתוך הטקסט?

הבחירות של המשתתפים מוקפות בסימנים מיוחדים של חצים כפולים. אפשר לחלץ אותן בקלות בעזרת ביטוי רגולרי פשוט על שדה הטקסט.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה datasets באמצעות המזהה marcelbinz/Psych-101. המאגר פתוח לחלוטין לציבור ואינו דורש אישור גישה מיוחד או מילוי טפסים. הקבצים כוללים קובץ jsonl בשם prompts_training, כך שהמבנה פשוט לקריאה ולעיבוד מקומי.

לפני שמתחילים להריץ אימון, חשוב לבנות מפענח שיודע לחלץ את התוכן מתוך התגיות הייעודיות שמסמנות את הבחירה. השדות המרכזיים שצריך לסנן לפיהם הם experiment ו־participant, במיוחד אם רוצים לפצל את המידע לקבוצות אימון ובדיקה לפי נסיינים שונים ולא לערבב אותם.

from datasets import load_dataset

ds = load_dataset("marcelbinz/Psych-101")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים והפצה שלהם מחדש. אין דרישה לשתף את המודל המאומן או תוצרי המשך תחת אותו הרישיון, אבל חובה לשמור על הודעת זכויות היוצרים המקורית והצהרת הרישיון בכל שימוש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗