GPT
R

reward-bench

קוד פתוח

allenaiodc-by2023-12-14

אפשר גם להריץ אותו בדפדפן בלי להתקין דבר.

המאגר מרכז צמדי תשובות לבדיקת מודלי תגמול בארבע קטגוריות מרכזיות. הוא נועד להעריך בצורה ישירה אם המודל שלכם יודע להבדיל בין פלט איכותי לפלט שגוי או מסוכן.

  • 10,297הורדות בחודש
  • 109לייקים

מה זה

המאגר כולל 2,985 פרומפטים בפורמט של פנייה בודדת. כל רשומה מציגה את ההוראה המקורית לצד שתי תשובות אפשריות, תשובה נבחרת ועדיפה לעומת תשובה שנדחתה, יחד עם שמות המודלים שיצרו אותן בחלק מהמקרים ומזהה ייחודי. המטרה של מודל תגמול שנבדק כאן היא לתת ניקוד גבוה יותר לתשובה הנבחרת ביחס לנדחית.

התוכן מחולק לארבעה תחומים: שיחה כללית, שיחה מאתגרת הכוללת מלכודות והתקפות יריב, בטיחות וסירובים, והסקה שכוללת בעיות מתמטיקה וקוד בשש שפות תכנות שונות. הנתונים לא נכתבו מאפס אלא נאספו ממאגרים קיימים כמו AlpacaEval, MT Bench, HumanEvalPack, XSTest ואחרים, לצד פרומפטים של סירובים שנוצרו במיוחד.

מתוך 5,123 רשומות מקוריות, הצוות ביצע סינון ידני קפדני בחלק מהקטגוריות כדי לוודא שהדירוג בין התשובות אכן חד משמעי. חלקים אחרים עברו סינון אוטומטי שהתבסס על מטא-דאטה מובנה ואימות ידני משלים.

מתאים ל

  • הערכת מודלי תגמול

    בדיקת יכולת המודל להעניק ציון גבוה יותר לתשובות איכותיות על פני תשובות גרועות.

  • בדיקת עמידות ובטיחות

    מדידת הנטייה של המודל לזהות סירובים מוצדקים מול סירובי שווא בבקשות רגישות.

  • השוואת ביצועי קוד ומתמטיקה

    בחינה אם המודל מבדיל בין קוד תקין לשגוי בשש שפות תכנות שונות ובפתרון משוואות.

איפה זה נופל

הנתונים כולם באנגלית בלבד, כך שאין שום דרך להעריך בעזרתם ביצועים בעברית או בהקשר תרבותי ישראלי. כל הדוגמאות מוגבלות לפנייה בודדת ללא שיחה מרובת שלבים, מה שלא מייצג שימוש אמיתי בצ'אטים ארוכים. נוסף לכך, המאגר נועד להערכה בלבד ולא לאימון. אם תאמנו עליו, תזהמו את מדד הבדיקה שלכם ותקבלו תוצאות מוטות שלא מעידות על איכות המודל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא בצורה ישירה. המאגר עצמו מוגדר תחת רישיון פתוח, אבל הוא כולל בתוכו תת-מאגרים שמוגנים תחת רישיונות שאוסרים שימוש מסחרי לחלוטין. אם תשתמשו בו לצורך בניית מודל מסחרי, אתם מסתכנים בהפרת תנאי המקור של אותם חלקים.

האם המאגר כולל תמיכה בעברית?

לא, כל הפרומפטים והתשובות במאגר כתובים באנגלית בלבד. אם המערכת שלכם מיועדת לעבודה בעברית, המדד הזה לא ייתן לכם אינדיקציה לגבי איכות התגמול בשפה המקומית.

האם כדאי לאמן מודלים על הדאטהסט הזה?

ממש לא, מדובר במאגר הערכה נטו שמכיל פחות משלושת אלפים דוגמאות. אימון על הנתונים האלה יהרוס לכם את היכולת לבדוק את המודל בצורה אובייקטיבית ויגרום להתאמת יתר למבחן עצמו.

איך אספו וסיננו את הנתונים?

החוקרים לקחו נתונים ממאגרים קיימים כמו AlpacaEval ו־MT Bench וצמצמו אותם מתוך מעל חמשת אלפים רשומות מקור. חלק מהבדיקות סוננו ידנית לחלוטין כדי לאמת את נכונות התשובות, וחלק עברו סינון אוטומטי מבוסס מטא-דאטה לצד בקרה ידנית.

איך טוענים

טוענים את הקובץ ישירות דרך ספריית הנתונים הרגילה של פייתון בלי צורך באישור גישה מיוחד. המאגר קטן יחסית, יושב בקובצי פרקט בודדים ומכיל פחות משלושת אלפים שורות, כך שההורדה והטעינה לזיכרון מתבצעות תוך שניות בודדות. כל הנתונים נמצאים בחלוקה אחת, ולכן כדי לבדוק קטגוריה ספציפית כמו שיחה או בטיחות צריך להפעיל סינון פשוט לפי שדה התת-מאגר. השדות העיקריים שמעניינים אתכם בקוד הם הפרומפט, שתי התשובות המתחרות והמזהה של הקטגוריה.

from datasets import load_dataset

ds = load_dataset("allenai/reward-bench")

הרישיון

המאגר מופץ תחת רישיון ODC-BY, שמחייב מתן קרדיט בלבד. עם זאת, בגלל שהוא אוסף נתונים ממקורות שונים, חלים עליכם גם הרישיונות של חלקי המקור. חלקים אלה כוללים רישיונות מגבילים כמו CC BY-NC 4.0 ו־CC BY-NC-SA 4.0 שמונעים שימוש מסחרי, לצד רכיבים ברישיונות מתירניים כמו MIT ו־Apache 2.0. אם אתם בונים מודל לשימוש מסחרי, החומרים האלה בעייתיים.

הרישיון המלא ב־Hugging Face ↗