GPT
W

wmdp

קוד פתוח

caismit2024-03-05

שאלות רב-ברירה שנועדו לבדוק אם מודל מחזיק בידע מסוכן על נשק ביולוגי, כימי וסייבר. החומר משמש לבחינת מודלים וגם לבדיקת שיטות מחיקת ידע מכוונות.

  • 26,893הורדות בחודש
  • 31לייקים

מה זה

המאגר מחולק לשלושה תחומים מרכזיים, שכל אחד מהם מיוצג בקובץ נפרד של שאלות אמריקאיות. החלק הביולוגי מכיל 1,273 שאלות, תחום הסייבר כולל 1,987 שאלות, והחלק הכימי קטן בהרבה ומונה 408 שאלות בלבד. המטרה של המבנה הזה היא לשמש מדד עקיף לנוכחות של ידע מסוכן ובעל פוטנציאל שימוש כפול במודלי שפה.

היוצרים עדכנו את התוכן באפריל 2024 והסירו שאלות מסוימות. בחלק הביולוגי נופו פריטים לאחר שהתברר שאין בהם מספיק פוטנציאל לשימוש כפול, ובחלק הסייבר הוסרו שאלות ארוכות במיוחד שהקשו על הרצה באצוות קבועות, לצד תיקוני קידוד וערבוב תשובות שנעשו עוד קודם.

מתאים ל

  • הערכת סיכוני בטיחות

    בדיקה אם מודל שפה פתוח מחזיק בידע מפורט על נשק ביולוגי, כימי או חולשות סייבר.

  • בחינת שיטות מחיקת ידע

    מדידת היעילות של אלגוריתמים שמנסים להסיר ידע מסוכן ספציפי בלי לפגוע ביכולות אחרות.

  • סינון מודלים לפני פריסה

    הרצה כחלק מצינור בדיקות אוטומטי כדי לוודא שמודל לא חורג מספי בטיחות מוגדרים.

איפה זה נופל

המאגר כולו כתוב באנגלית בלבד, ואין בו שום ייצוג למונחים או שאלות בעברית. הכיסוי הכימי מצומצם יחסית עם 408 שאלות, מה שהופך את המדד שם לרגיש יותר לכל ניחוש או טעות מקרית. מעבר לזה, היוצרים עצמם נאלצו להסיר שאלות בגלל חוסר התאמה להגדרת שימוש כפול, מה שמראה שהגבול סביב מה שנחשב ידע מסוכן אינו מוחלט. מדובר במבחן אמריקאי בלבד, לכן הוא בודק זיהוי של תשובות נכונות ולא את היכולת המעשית של המודל לייצר תוכניות תקיפה מאפס.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

הרישיון הרשמי הוא MIT, כך שמבחינה משפטית אין מניעה לשימוש מסחרי בקוד ובשאלות. עם זאת, מטרת המאגר היא בדיקה בלבד, והיוצרים מבקשים לא להשתמש בנתונים האלה לאימון מודלים כדי לא לקלקל את אמינות המבחן.

האם יש תמיכה בשפה העברית?

לא, כל השאלות והתשובות במאגר מנוסחות באנגלית. אם המודל שלכם מיועד לעבודה בעברית, תוכלו לבדוק רק את הבנת המושגים שלו באנגלית, או לתרגם את השאלות בעצמכם.

כמה שטח אחסון צריך בשביל להריץ אותו?

המאגר קטן מאוד וכולל פחות מ־4,000 שאלות בסך הכל בשלושה קבצי פאקרה. ההורדה לוקחת שניות בודדות ולא דורשת משאבי חומרה מיוחדים מעבר לסביבת ההרצה של המודל עצמו.

איך השאלות נבחרו וסוננו?

השאלות נבנו סביב תחומי אבטחה ביולוגית, כימית וסייבר. לאחר הפרסום המקורי בוצע סינון נוסף שבו הוסרו שאלות ארוכות מדי ושאלות שלא הציגו פוטנציאל ממשי לשימוש כפול מסוכן.

איך טוענים

הנתונים יושבים בשלושה קבצי פאקרה נפרדים לפי התחומים, כך שאפשר לטעון בדיוק את החלק הרלוונטי לבדיקה שלכם ישירות דרך הספרייה של האגינג פייס. אין צורך לבקש אישור גישה מיוחד למאגר כאן, אם כי היוצרים מציעים גם גיבויים חיצוניים שמוגנים בסיסמה.

ההרצה הסטנדרטית נתמכת ישירות בתוך התשתית של lm-evaluation-harness, וזה חוסך כתיבה של קוד הערכה מאפס. המאגר מכיל כמה אלפי שאלות בסך הכל, כך שלא תיתקלו בבעיות של מקום בדיסק או זמני הורדה ארוכים, אבל כן כדאי לשים לב לעדכוני הגרסה כדי לא לעבוד בטעות על קבצים ישנים עם בעיות הקידוד המקוריות.

from datasets import load_dataset

ds = load_dataset("cais/wmdp")

הרישיון

הפרויקט מופץ תחת רישיון MIT, מה שמאפשר שימוש חופשי לחלוטין לצרכים מחקריים ומסחריים, כולל שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים המקורית. אין כאן דרישה להדבקת רישיון זהה על תוצרים נגזרים. עם זאת, היוצרים הוסיפו מחרוזת מזהה מפורשת וביקשו לא להכניס את השאלות כחומר אימון לשום מודל, כדי למנוע זיהום של נתוני הבדיקה בעתיד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗