GPT
A

air-bench-2024

קוד פתוח

stanford-crfmcc-by-4.02024-06-05

  • safety

מאגר לבדיקת בטיחות מודלי שפה מול רגולציה ומדיניות תאגידית. הוא מרכז פרומפטים זדוניים לפי חלוקה גאוגרפית כדי לבדוק אם המודל מסרב לבקשות מסוכנות.

  • 8,166הורדות בחודש
  • 26לייקים

מה זה

המאגר כולל בין 1,000 ל־10,000 פרומפטים שנועדו לבחון עמידות של מודלים. הנתונים בנויים לפי טקסונומיית בטיחות של שנת 2024, עם חלוקה לרמות קטגוריה שונות, ומכילים בקשות זדוניות ומורכבות שמנסות לאתגר את מנגנוני ההגנה.

בפנים יש שני חלקים עיקריים. החלק הבסיסי מחזיק את הפרומפטים שנשלחים למודל הנבדק, כולל שיוך לקטגוריות כמו רמה שתיים, שלוש וארבע. החלק השני, judge_prompts, מכיל תבניות מוכנות למודל שופט, שבהן משבצים את שאלת המקור ואת התשובה שנוצרה כדי לקבוע אם התוצאה בטוחה.

המבנה מאפשר סינון לפי אזורים גאוגרפיים בעולם: ארצות הברית, סין, והאיחוד האירופי ברמות שונות של דרישות חוקיות. מי שיצר את המאגר ואיך בדיוק סוננו הפרומפטים לא מפורט בכרטיס, והנתונים נשמרים בקובצי CSV נפרדים לפי קטגוריות.

מתאים ל

  • הערכת בטיחות למודל שפה

    בדיקת שיעור הסירוב של מודל מול פרומפטים עוינים באנגלית.

  • בדיקת התאמה לרגולציה

    הרצת בדיקות ייעודיות לתקנות של האיחוד האירופי, ארה"ב או סין.

  • שיפוט אוטומטי של תשובות

    שימוש בתבניות המובנות להפעלת מודל שופט שמעריך את בטיחות הפלט.

איפה זה נופל

המאגר קיים כולו באנגלית בלבד. אם המוצר שלכם פונה לקהל ישראלי וצריך להתמודד עם פרומפטים בעברית או עם הקשרים מקומיים, אין כאן מענה ישיר. מעבר לכך, בכרטיס המקורי סעיפי ההטיות, הסיכונים והמגבלות ריקים לגמרי ולא מפרטים מי עומד מאחורי איסוף הדוגמאות, כך שקשה לדעת אילו סוגי תקיפות נשמטו החוצה ולא נבדקו כאן בכלל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא CC-BY-4.0, והוא מתיר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט ברור למפרסמי המאגר.

האם המאגר כולל בדיקות בשפה העברית?

לא. כל הנתונים רשומים באנגלית בלבד. כדי לבדוק מודל בעברית תצטרכו לתרגם את הפרומפטים או לבנות סט בדיקה נפרד.

איך נאספו הפרומפטים האלה?

יוצרי המאגר השאירו את סעיף יצירת הנתונים ריק בכרטיס. ידוע רק שהם חילקו אותם לפי קטגוריות של רגולציה ומדיניות משנת 2024, אך אופן הניסוח והאיסוף המדויק לא פורסם שם.

איך משתמשים בתבניות השופט שמגיעות עם המאגר?

טוענים את התת-מאגר judge_prompts בפייתון ומחלצים את התבנית לפי הקטגוריה הרצויה. בתבנית מחליפים את המשתנה של השאלה בפרומפט המקורי, ואת משתנה התשובה בטקסט שהמודל שלכם ייצר, ושולחים למודל שופט.

איך טוענים

טוענים את הנתונים דרך ספריית datasets הרגילה בפייתון ישירות מהנתיב stanford-crfm/air-bench-2024. אין צורך לבקש אישור גישה מיוחד, והמאגר פתוח להורדה מיידית בחלוקה ל־test split.

אפשר לבחור תת-מאגר אזורי ספציפי כמו us או china, או לטעון את תבניות השיפוט. השדות העיקריים הם prompt שבו נמצא הטקסט הזדוני, וקטגוריות הסיווג השונות. אפשר גם להריץ את הבדיקה ישירות דרך כלי ההערכה HELM של סטנפורד בשורת פקודה.

from datasets import load_dataset

ds = load_dataset("stanford-crfm/air-bench-2024")

הרישיון

הרישיון הוא CC-BY-4.0. המשמעות פשוטה: מותר להשתמש בנתונים לצרכים מסחריים ומחקריים, מותר לשנות אותם ולשלב אותם בתהליכי בדיקה של מודלים. החובה היחידה היא לתת קרדיט הולם ליוצרים המקוריים ולציין אם נעשו שינויים, בלי חובת שיתוף תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗