GPT
M

model-written-evals

קוד פתוח

Anthropiccc-by-4.02022-12-21

  • gender bias
  • social bias
  • AI safety
  • personality
  • politics

מאגר מבחנים שנוצר על ידי מודלי שפה כדי לבדוק נטייה להתרפסות, עמדות אישיות וסיכוני בטיחות מתקדמים. הוא שימושי למי שרוצה לאמוד התנהגות מודל שיחה בלי לכתוב שאלות ידנית.

  • 2,779הורדות בחודש
  • 68לייקים

מה זה

המאגר מורכב מבין מאה אלף למיליון רשומות המחולקות למשימות של שאלות רב ברירה, מענה לשאלות וסיווג. רוב הדאטה נוצר ישירות על ידי מודלים שיועדו לבחון סוכני שיחה, ומיועד להעריך איך המודל מגיב למשתמש בענייני מוסר, פוליטיקה או חיפוש כוח.

התוכן מחולק לארבע תיקיות עיקריות. החלק של persona בודק תכונות אישיות, אמונות ורצון בשימור עצמי. החלק של sycophancy בוחן נטייה לחזור על עמדות המשתמש בנושאי פילוסופיה ומחקר. החלק של advanced-ai-risk כולל שאלות על סיכונים קטסטרופליים, ומשלב גם דוגמאות שנכתבו בידי אדם דרך Surge AI כדי להשוות בין המקורות. החלק האחרון, winogenerated, מרחיב את מבחני Winogender לבדיקת הטיות מגדריות על בסיס נתוני תעסוקה.

מתאים ל

  • מדידת התרפסות

    בדיקה אם מודל השיחה שלכם נוטה להסכים אוטומטית עם דעות המשתמש במקום לענות באופן ענייני.

  • זיהוי חיפוש כוח

    הערכת תגובות של מודלים בנושאי שימור עצמי ושאיפה להשגת שליטה במערכות ממוחשבות.

  • בדיקת הטיות מגדר

    שימוש בחלק ה־winogenerated להערכת הטיות מגדריות ביחס למקצועות ותפקידים שונים.

איפה זה נופל

הטקסט כולו באנגלית בלבד, כך שהוא לא יעזור ישירות למי שבוחן מודל בעברית. רוב הדאטה יוצר על ידי מודלים בעצמם, ולכן הוא כולל הטיות חברתיות, סטריאוטיפים ותכנים פוגעניים שהיוצרים מודים בקיומם. הנתונים פורסמו בסוף 2022, כך שהם לא משקפים התנהגויות של מודלים חדשים יותר, ולא הייתי מכניס אותם לאימון ישיר של מוצר בלי סינון קפדני של התשובות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, רישיון cc-by-4.0 מתיר שימוש מסחרי מלא. אתם רק צריכים לתת קרדיט ל־Anthropic לפי תנאי הרישיון, ואין מגבלה שמונעת להעריך מודל שמיועד למכירה.

האם יש במאגר שאלות בעברית?

לא. המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד. אם המערכת שלכם מיועדת לקהל ישראלי ופועלת בעברית, תצטרכו לתרגם את המבחנים או להתאים אותם מקומית.

מאיפה הגיעו הנתונים שנמצאים בקבצים?

רוב המבחנים נוצרו ישירות על ידי מודלי שפה שקיבלו הנחיות ליצור שאלות הערכה. חלק קטן יותר, ספציפית בתיקיית סיכוני ה־AI, נכתב על ידי בני אדם דרך Surge AI לצורכי השוואה.

באיזה מבנה מגיעים הנתונים?

המאגר מחולק ל־159 קבצים, רובם קובצי jsonl לפי נושאים כמו persona או sycophancy. כל קובץ מתמקד בהתנהגות ספציפית ומציג שאלות בפורמט של ברירה מרובה או תשובות קצרות.

איך טוענים

הנתונים מפוזרים על פני 159 קבצים, בעיקר בפורמט jsonl בתוך תיקיות המשנה השונות. אין צורך לבקש אישור גישה מיוחד כדי להוריד אותם מחשבון Anthropic. בעבודה עם הקבצים, בעיקר בקטגוריית הסיכונים וההתרפסות, צריך לשים לב לשדות השאלות ואפשרויות הבחירה כדי למדוד את נטיית המודל.

from datasets import load_dataset

ds = load_dataset("Anthropic/model-written-evals")

הרישיון

הרישיון הוא cc-by-4.0. מותר להשתמש בדאטה לצרכים מסחריים, לשנות אותו ולשלב אותו במערכות אחרות, כולל שימוש בו לצורך הערכה של מודלים מסחריים. התנאי היחיד הוא מתן קרדיט מתאים ליוצרים, ואין חובה לשתף את הנגזרות או את המודלים באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗