GPT
O

or-bench

קוד פתוח

bench-llmcc-by-4.02024-05-09

  • llm
  • alignment
  • over-alignment

מאגר לבדיקת סירובי יתר שמכיל פרומפטים תמימים שנשמעים רעילים לצד בקשות פוגעניות. הוא בודק אם המודל שלכם באמת מבדיל בין תוכן אסור לבין שיחה לגיטימית.

  • 8,186הורדות בחודש
  • 22לייקים

מה זה

הנתונים נועדו למדוד נקודה רגישה באימון מודלים, הנטייה לסרב לבקשות לגיטימיות שנשמעות בעייתיות במבט ראשון. לפי התיעוד המאגר מורכב משני חלקים מרכזיים, חלק שנקרא OR-Bench-Hard-1K וחלק שמוגדר בתור OR-Bench-Toxic. החלק הראשון בודק מקרים קשים של בקשות בטוחות שהמודל עלול לדחות בטעות, והחלק השני בוחן סירוב ישיר לבקשות רעילות.

איסוף הפרומפטים שנראים רעילים נעשה בתהליך אוטומטי מובנה, שמייצר בקשות מעודכנות באופן שוטף כדי לאתגר את מנגנוני הבטיחות. היוצרים בחנו את הנתונים מול עשרות מודלים מובילים, כולל גרסאות שונות של GPT-4, קלוד, ג'מיני, לאמה ומיסטרל, במטרה לבנות מדד השוואתי אחיד לתופעה.

מתאים ל

  • מדידת סירובי יתר

    בדיקה אם מודל שאימנתם מסרב בטעות לשאלות תמימות שנשמעות מסוכנות.

  • הערכת עמידות לרעלים

    מדידת אחוז החסימה של בקשות פוגעניות לפי הסט הרעיל של המאגר.

  • השוואת ביצועי בטיחות

    הצבת מודל מול תוצאות ייחוס של גרסאות מסחריות כמו GPT-4 וקלוד.

איפה זה נופל

כל הנתונים במאגר קיימים באנגלית בלבד, כך שאין שום אפשרות להעריך בעזרתו מודלים בעברית או תרחישי סירוב מקומיים. מעבר לכך, הכרטיס לא מפרט את המבנה הפנימי המדויק של קובצי הטקסט, ולא חושף את החלוקה המדויקת של קטגוריות הנזק בתוך החלק הרעיל. לפני שמשלבים את המאגר בבדיקות של מוצר, חייבים לדגום את הפרומפטים שנוצרו אוטומטית כדי לוודא שאין בהם טעויות תיוג.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

כן, הרישיון שדווח הוא cc-by-4.0 שמתיר שימוש מסחרי מלא. התנאי היחיד שהרישיון דורש הוא מתן קרדיט מתאים ליוצרי המאגר bench-llm. אין מניעה חוקית לבחון מודל פנימי או מסחרי על בסיס הנתונים האלה.

האם יש במאגר תמיכה בשפה העברית?

לא, המאגר מוגדר וכולל נתונים בשפה האנגלית בלבד. אם תרצו לבדוק מודלים שפונים לקהל מקומי בישראל, תצטרכו לתרגם את השאלות או לבנות סט דומה בעצמכם. אין כאן התייחסות לסלנג, הקשר תרבותי מקומי או רגולציה ישראלית.

איך נאספו השאלות שמופיעות בדאטהסט?

החוקרים בנו צינור עבודה אוטומטי שמייצר פרומפטים שנראים רעילים על פני השטח, אך למעשה הם בטוחים למענה. התהליך תוכנן לייצר דוגמאות חדשות באופן רציף כדי לאתגר מודלים מאומנים. המטרה של התהליך היא לחשוף פערים בין סירוב מוצדק לבין פסילה עיוורת לפי מילות מפתח.

איך טוענים

טוענים את המאגר ישירות מתוך Hugging Face בעזרת הספרייה הסטנדרטית, ללא צורך באישור גישה מוקדם או בהרשמה מיוחדת. המאגר כולל 34 קבצים שמכילים בעיקר תרשימי ביצועים ונתוני טקסט, כך שזמן ההורדה והמשקל זניחים לחלוטין. הוא מתאים להרצה בסביבות הערכה מקומיות של משימות יצירת טקסט ומענה על שאלות.

from datasets import load_dataset

ds = load_dataset("bench-llm/or-bench")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. המשמעות היא שאתם רשאים להשתמש בו לצרכים פנימיים או מסחריים, להעתיק אותו ולשנות אותו בחופשיות. התנאי היחיד הוא מתן קרדיט ברור ליוצרים. שימוש בנתונים לצורך אימון מודל מסחרי מותר לפי תנאי הרישיון, כל עוד הייחוס נשמר.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗