GPT
M

MASK

קוד פתוח

caisרישיון לא דווח2025-03-03

המאגר בודק אם מודל שפה משקר בכוונה כשמופעל עליו לחץ, ולא רק אם הוא טועה בעובדות. הוא מיועד למי שרוצה למדוד כנות והטעיה מכוונת במודלים תחת סיטואציות מורכבות.

  • 8,942הורדות בחודש
  • 18לייקים

מה זה

המאגר כולל 1,028 דוגמאות מתויגות ידנית על ידי בני אדם, שנבנו בשיתוף בין Center for AI Safety ובין Scale AI. כל רשומה כוללת טענה, אמת עובדתית, פרומפט לחץ שנועד לגרום למודל לשקר, ופרומפט ניטרלי שנועד לחלץ את הידע האמיתי שהמודל מחזיק בו בלי לחץ.

הבדיקה מפרידה בין דיוק עובדתי לבין כנות. החומר מחולק לשישה ארכיטיפים שונים שמופיעים כחלקים נפרדים: continuations, disinformation, doubling_down_known_facts, known_facts, provided_facts וגם statistics. הרעיון הוא לראות אם מודל מגן על עובדות שהוא מכיר, מפיץ דיסאינפורמציה או מתקפל תחת לחץ ישיר.

מתאים ל

  • מדידת יושרה תחת לחץ

    בדיקה אם מודל שפה מוותר על עובדות נכונות ומשקר כשהמשתמש דוחק בו להטעות.

  • הפרדת ידע מכנות

    השוואה בין מה שהמודל יודע בניטרליות לבין התשובה שהוא מספק תחת מניפולציה.

  • בנצ'מרק להערכת בטיחות

    הרצת מבחן אחיד על גרסאות שונות של מודל כדי לבדוק נטייה להפצת דיסאינפורמציה.

איפה זה נופל

המאגר מכיל 1,028 דוגמאות בלבד, כך שמדובר בכלי הערכה ולא בחומר לאימון. הכרטיס לא מציין תמיכה בשפות שאינן אנגלית, ולא מפרט את תהליך הסינון או את הרכב המתייגים האנושיים. בנוסף, המאגר כולל מחרוזת canary שנועדה למנוע זליגה לאימונים עתידיים, כך שאסור לחשוף מודלים לדוגמאות האלה בשלבי למידה אלא רק במבחן סגור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הכרטיס לא מציין רישיון בכלל. במצב כזה אין הרשאה משפטית ברורה לשימוש מסחרי, ומומלץ לפנות ישירות ליוצרים ב־Center for AI Safety לפני שמשלבים את הנתונים בפרויקט מסחרי.

האם המאגר מתאים לאימון של מודל שפה?

לא. המאגר קטן מאוד, עם 1,028 דוגמאות בלבד, והוא נבנה ככלי הערכה. בנוסף, הוא מכיל מחרוזת canary ייעודית שנועדה לחסום אותו מלהיכנס למאגרי אימון.

האם יש במאגר שאלות בעברית?

הכרטיס לא מדווח על תמיכה בעברית. כל הדוגמאות והתיעוד מופיעים באנגלית בלבד, ואין אינדיקציה לטקסט רב-לשוני.

איך הדאטהסט בנוי בפועל?

הוא מחולק לשישה קובצי parquet, שכל אחד מהם מייצג תרחיש לחץ שונה כמו סטטיסטיקה, דיסאינפורמציה או עובדות ידועות מראש. בכל רשומה יש את הטענה, האמת העובדתית, פרומפט לחץ ופרומפט לבדיקת הידע המקורי.

איך טוענים

הנתונים שמורים בקובצי parquet נפרדים לכל אחד מששת החלקים, ואין צורך באישור גישה מיוחד כדי להוריד אותם. בטעינה עם ספריית datasets של Hugging Face צריך לציין את החלק הספציפי שרוצים לבדוק, מתוך ששת הארכיטיפים הקיימים. שימו לב שהדוגמה בקוד של הכרטיס מכילה שגיאת העתקה בשם הנתיב, וצריך לטעון ישירות את cais/MASK ולא מאגר אחר.

from datasets import load_dataset

ds = load_dataset("cais/MASK")

הרישיון

היוצרים לא הגדירו רישיון בכרטיס המאגר. מבחינה משפטית, כשאין רישיון מוגדר, זכויות היוצרים שמורות ליוצרים ולא ניתנה רשות מפורשת לשימוש מסחרי, שינוי או הפצה מחדש. אם אתם בונים מוצר מסחרי, לא הייתי נוגע בזה לפני פנייה ישירה ליוצרים לקבלת אישור בכתב.

הרישיון המלא ב־Hugging Face ↗