GPT
L

llm_global_opinions

קוד פתוח

Anthropiccc-by-nc-sa-4.02023-06-26

שאלות סקר בינלאומיות על נושאים סובייקטיביים עם התפלגות תשובות לפי מדינות. הוא מיועד לבדיקת עמדות והטיות תרבותיות במודלי שפה מול דעת קהל אמיתית.

  • 1,596הורדות בחודש
  • 60לייקים

מה זה

המאגר מכיל בין אלף לעשרת אלפים שאלות סקר שנלקחו מתוך שני מקורות מרכזיים, סקר הערכים העולמי וסקר העמדות הגלובלי של מכון פיו. אנתרופיק ליקטו תת קבוצה של שאלות מתוך הסקרים האלה במטרה לבדוק לאילו דעות ותרבויות מודלים נוטים כשהם נשאלים על נושאים מורכבים ללא תשובה עובדתית אחת.

המבנה מאורגן בקובץ טבלאי פשוט. כל שורה מייצגת שאלה אחת וכוללת את נוסח השאלה, רשימת אפשרויות התשובה, המקור שממנו השאלה הגיעה, ומילון שממפה שמות של מדינות לאחוזי המשיבים שבחרו בכל אחת מהאפשרויות הזמינות. המידע מחולק לפי המקור שממנו נלקח, מה שמאפשר להשוות ישירות בין התשובה שהמודל מייצר לבין נתוני אמת של אוכלוסיות שונות בעולם.

מתאים ל

  • בנצ'מרק להטיות תרבותיות

    השוואת נטיית המודל בשאלות שנויות במחלוקת מול התפלגות העמדות במדינות שונות.

  • הערכת עמדות מודלים

    בדיקת התשובות שמייצר מודל שפה מול אחוזי ההסכמה האמיתיים שנמדדו בסקרי דעת קהל.

  • מחקר סוציולוגי בבינה מלאכותית

    ניתוח האופן שבו מודלים שונים מייצגים תפיסות עולם מגוונות בנושאים גלובליים.

איפה זה נופל

החוקרים מודים במפורש שתוקף המבנה של הנתונים מוגבל כשהוא מוחל על מודלי שפה, משום שהסקרים המקוריים נבנו עבור בני אדם ולא נועדו להערכת בינה מלאכותית. בנוסף, כל השאלות מנוסחות באנגלית בלבד, כך שאי אפשר לבדוק כאן הטיות בשפות מקומיות אחרות, כולל עברית. נתוני הסקרים משקפים תקופות זמן מסוימות שבהן הם נערכו ולא עמדות עכשוויות שמשתנות תדיר, ולכן לא מומלץ להסתמך עליהם כבסיס יחיד לקבלת החלטות במוצר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון של המאגר הוא רישיון לא מסחרי. מותר להשתמש בו אך ורק למחקר פנימי או אקדמי, ואסור לשלב אותו בתהליכי אימון של מודלים שמיועדים למכירה או לשימוש עסקי.

האם הנתונים כוללים שאלות ותשובות בעברית?

לא. כל הנתונים מופיעים באנגלית בלבד. השאלות והתשובות נלקחו מסקרים בינלאומיים אך הונגשו במאגר הזה בשפה האנגלית, ולכן לא ניתן להעריך בעזרתו מודלים בשפה העברית ללא תרגום.

איך נאספו הנתונים שבמאגר?

אנתרופיק ליקטו תת קבוצה של שאלות מתוך שני סקרים עולמיים מוכרים, סקר הערכים העולמי וסקר העמדות של מכון פיו. הם חיברו את נוסח השאלות יחד עם פילוחי ההצבעה של המשיבים לפי מדינות לתוך קובץ נתונים אחיד.

כמה מקום המאגר תופס בדיסק והאם צריך אישור גישה?

המאגר קטן מאוד, מכיל כמה אלפי רשומות בקובץ טקסט יחיד, ויורד תוך שניות בודדות. הגישה אליו פתוחה לחלוטין ואין צורך לקבל אישור מיוחד או להירשם ברשימת המתנה.

איך טוענים

טוענים את המאגר ישירות בעזרת פקודת load_dataset רגילה של ספריית datasets, בלי צורך בבקשת גישה או אישור מוקדם. הנתונים יושבים בקובץ CSV יחיד שאינו תופס נפח משמעותי, כך שההורדה מסתיימת תוך שניות בודדות. השדות שמעניינים אתכם הם טקסט השאלה, האפשרויות, ומילון הבחירות שמכיל את נתוני המדינות והאחוזים לצורך השוואה מול תשובות המודל.

from datasets import load_dataset

ds = load_dataset("Anthropic/llm_global_opinions")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-sa-4.0. המשמעות פשוטה: השימוש המסחרי אסור לחלוטין, ואפשר להשתמש בו למטרות מחקר בלבד. חובה לתת קרדיט ליוצרים, ואם אתם מפיצים גרסה ששיניתם או עיבדתם, אתם מחויבים לפרסם אותה תחת אותו הרישיון בדיוק. אם תאמנו עליו מודל, סביר שלא תוכלו למכור את המודל או להשתמש בו במוצר מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗