GPT
D

do-not-answer

קוד פתוח

LibrAIapache-2.02023-08-28

  • safety
  • large language model

אוסף של 939 הנחיות פוגעניות שנועדו לבדוק אם מודל שפה יודע לסרב לענות. הוא שימושי למי שרוצה לבחון מנגנוני בטיחות בלי לבזבז זמן ומשאבים על יצירת מבחנים ידניים מאפס.

  • 3,940הורדות בחודש
  • 57לייקים

מה זה

המאגר מכיל בדיוק 939 הוראות טקסטואליות באנגלית, שנאספו ונבררו ידנית כדי לייצג בקשות שמודל אחראי חייב לסרב להן. המבנה הפנימי מבוסס על היררכיה של שלוש רמות, הכוללת חמישה תחומי סיכון, 12 סוגי פגיעה וחלוקה מפורטת לשישים ואחד נזקים ספציפיים. ההנחיות הללו לא נועדו לאימון מודלים אלא לשמש כמבחן בוחן קבוע להתנהגות המערכת מול משתמש שמנסה לקבל מענה אסור.

בנוסף להנחיות עצמן, התיעוד כולל הערכות של תשובות שנאספו משישה מודלים שונים, בהם לאמה שתיים, קלוד וגרסאות של גיפיטי. התשובות סווגו לפי שתי רמות: קביעה בינארית האם התשובה מזיקה או בטוחה, וחלוקה לשש קטגוריות פעולה שמגדירות את אופי התגובה של המודל, מסירוב ישיר ועד מתן מענה. התיוג בוצע על ידי בני אדם ושימש להשוואה מול מודל סיווג ייעודי מבוסס לונגפורמר.

מתאים ל

  • הערכת בטיחות למודל

    הרצה של 939 ההנחיות מול מודל חדש כדי לבדוק באילו מקרים הוא נכשל ומחזיר תשובה מזיקה במקום לסרב.

  • בדיקת מסווגי תוכן

    שימוש ברשימת הפרומפטים כדי לבחון אם מנגנון פילטור חיצוני או פיירוול מזהה בקשות אסורות בזמן אמת.

  • השוואת ביצועים מול שוק

    מדידת אחוז התגובות הבטוחות שלכם ביחס לתוצאות שפורסמו עבור דגמים כמו לאמה שתיים וקלוד.

איפה זה נופל

המאגר כולו מוגבל לשפה האנגלית בלבד, כך שהוא לא יעזור לכם לבדוק סירובים או פריצות בעברית. היקף של 939 רשומות הוא קטן ומכסה בעיקר מקרים מוגדרים מראש, בלי התחכמויות של הנדסת פרומפטים מורכבת או התקפות עקיפות. הנתונים פורסמו באוגוסט 2023, והמודלים שנבדקו בו אז כבר עודכנו כמה פעמים, כך שרמת הבטיחות המוצגת שם לא בהכרח משקפת את הגרסאות הנוכחיות בשוק.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. למרות שבדף המאגר מופיע רישיון אפאצ׳י שמתיר שימוש מסחרי, הטקסט של היוצרים מבהיר שהנתונים מוגנים ברישיון שמגביל שימוש למטרות לא מסחריות בלבד. אם המטרה שלכם היא להטמיע את זה במוצר שנמכר ללקוחות, הרישיון הזה לא מאפשר זאת.

האם יש בדאטהסט פרומפטים בעברית?

אין בו עברית כלל. כל 939 ההנחיות כתובות באנגלית ומייצגות נורמות בטיחות באנגלית בלבד. אם אתם בונים שירות לשוק הישראלי, תצטרכו לתרגם את המקרים או לבנות מבחן מקומי שמתאים לסיכונים בשפה העברית.

כמה מקום המאגר תופס במחשב?

הנפח זניח לחלוטין. מדובר בפחות מאלף שורות טקסט שנשמרות בקובץ קטן, כך שההורדה לוקחת שניות בודדות ולא דורשת שום משאבי אחסון מיוחדים או חומרה כבדה.

מאיפה הגיעו ההנחיות שנמצאות בפנים?

החוקרים אספו וניסחו את ההוראות ידנית כדי שיכסו חמישה תחומי סיכון ושישים ואחד נזקים ספציפיים. הרעיון היה לבודד רק בקשות ברורות שכל מודל שפה אחראי אמור לסרב להן בלי היסוס.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטס הרגילה של האגינג פייס לפי המזהה LibrAI/do-not-answer. הגישה חופשית לגמרי ואין צורך להמתין לאישור של היוצרים או למלא טופסי בקשה. נפח הקבצים קטן מאוד, פחות מאלף רשומות טקסט, כך שזמן ההורדה אפסי. שדות המפתח החשובים לשימוש הם הטקסט של ההנחיה עצמה והשיוך שלה לטקסונומיית הסיכונים, שדרכם אפשר להריץ בדיקה אוטומטית על המודל שלכם.

from datasets import load_dataset

ds = load_dataset("LibrAI/do-not-answer")

הרישיון

יש פה מלכוד ברישוי שחובה לשים אליו לב. המטאדאטה מדווח על רישיון אפאצ׳י שתיים, אבל כרטיס המאגר קובע במפורש שהנתונים עצמם מופצים תחת רישיון קריאייטיב קומונס לא מסחרי עם שיתוף זהה. קוד המקור חופשי, אבל בנתונים אסור להשתמש למוצרים מסחריים, וכל נגזרת דורשת ייחוס ושיתוף תחת אותם תנאים מגבילים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗