GPT
M

moral_stories

קוד פתוח

demelinmit2022-07-14

מאגר סיפורים קצרים ומובנים שמשווה בין פעולה נורמטיבית לסטייה חברתית והתוצאות שלהן. הוא מתאים למי שרוצה לבחון יכולת שיפוט מוסרי והיגיון חברתי במודלי שפה בלי לנחש הקשרים.

  • 2,564הורדות בחודש
  • 33לייקים

מה זה

כל רשומה מורכבת מנרטיב מובנה של שבעה משפטים, שמחולקים לנורמה מנחה, סיטואציה, כוונה ראשונית של הדמות, ושני מסלולים מקבילים. המסלול הראשון מציג פעולה שתואמת את הנורמה יחד עם התוצאה שלה, והמסלול השני מציג פעולה שסוטה מהנורמה ואת התוצאה המקבילה לה. המבנה הזה מייצר שני תתי סיפורים זהים לחלוטין ברקע, שנבדלים רק בבחירה המוסרית.

התוכן נאסף דרך מיקור המונים של כותבים דוברי אנגלית אמריקאית. החלוקה הפנימית מציעה שלושה סוגי פיצולים לאימון ובדיקה: פיצול לפי מרחק בין נורמות שבודק הכללה, פיצול שמנטרל הטיה לקסיקלית של מילים ספציפיות שחוזרות בפעולות, ופיצול זוגות מינימליים שמבוסס על מרחק עריכה קצר בין הפעולות.

מתאים ל

  • הערכת שיפוט חברתי במודלים

    בדיקת היכולת של מודלי שפה להבדיל בין פעולה מקובלת לסטייה מנורמה בסיטואציה נתונה.

  • אימון מסווגי התנהגות

    פיתוח מודלי סיווג שמזהים האם פעולה מסוימת מקדמת כוונה בהתאם לכללי התנהגות מוגדרים.

  • יצירת תחזיות תוצאה

    אימון מודלים גנרטיביים לחזות השלכות סבירות של מעשים על פי הקשר חברתי.

איפה זה נופל

הטקסטים נאספו מכותבים שמייצגים בעיקר אנגלית אמריקאית מיינסטרימית, ולכן הנורמות משקפות קונצנזוס תרבותי מערבי ספציפי שלא בהכרח תואם תרבויות אחרות. בנוסף, מודלים נוטים לפתח קיצורי דרך לקסיקליים סביב מילים שחוזרות בפעולות חיוביות או שליליות, תופעה שיוצרי המאגר ניסו לבודד בחלק מהפיצולים. אין כאן נתונים בעברית, וההתאמה לשוק המקומי תחייב תרגום והתאמה של הקשרים חברתיים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. רישיון MIT מאפשר שימוש מסחרי מלא, כולל אימון מודלים שיוטמעו במערכות סגורות בתשלום. הדרישה היחידה היא שמירה על הקרדיט ונוסח הרישיון המקורי בקבצים שלכם.

האם יש בדאטהסט נתונים בעברית?

לא, המאגר כולו כתוב באנגלית אמריקאית. כדי להשתמש בו במערכות שמיועדות לקהל ישראלי תצטרכו לתרגם את הרשומות, ולוודא שהנורמות החברתיות המובעות בהן הגיוניות ומותאמות להקשר התרבותי המקומי.

איך נאספו הסיפורים במאגר?

הנתונים נאספו מכותבים במסגרת מיקור המונים, שהתבקשו לכתוב סיפורים קצרים בני שבעה משפטים לפי שלד מובנה. החוקרים יצרו פיצולים ייעודיים לבדיקה כדי למנוע ממודלים להסתמך רק על מילים מסגירות במקום על הבנת הסיטואציה.

מה היתרון שלו מול מאגרי טקסט כלליים?

בניגוד לטקסט חופשי, כאן כל סיפור בנוי מזוג מינימלי של פעולה נורמטיבית ופעולה חורגת מאותה נקודת מוצא בדיוק. המבנה המקביל הזה מבודד את ההחלטה המוסרית ומאפשר לבדוק שיקול דעת חברתי בצורה מבוקרת ומדויקת.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטים של הגינג פייס או בקריאה ישירה מקובצי ה־JSONL שבמאגר, ללא צורך באישור גישה מראש. המאגר כולל 105 קבצים שמחולקים למשימות סיווג ויצירה. השדות המרכזיים כוללים את הנורמה, הסיטואציה, הכוונה, שתי הפעולות ושתי התוצאות, לצד שדה התווית שמשמש להערכת סיווג הפעולה או היתכנות התוצאה.

from datasets import load_dataset

ds = load_dataset("demelin/moral_stories")

הרישיון

המאגר מופץ תחת רישיון MIT פתוח לחלוטין. מותר להשתמש בו לצרכים מחקריים ומסחריים, לשנות אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית. הרישיון אינו מגביל שיווק של מודלים שאומנו עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗