GPT
R

reward-bench-2

קוד פתוח

allenaiodc-by2025-05-30

מאגר מבחן שמודד עד כמה מודלי תגמול מזהים תשובות נכונות מול הזיות וכשלים. אתם תרצו אותו אם אתם מפתחים מודל דירוג לתהליכי RLHF ומחפשים בנצ'מרק קשה שמבוסס על שאלות אנושיות שלא נראו באימון.

  • 3,708הורדות בחודש
  • 36לייקים

מה זה

כל רשומה במאגר כוללת שאלה בודדת, תשובה נבחרת אחת או יותר ושלוש תשובות שנדחו. המידע מחולק לשישה תחומים ברורים: דיוק עובדתי עם 475 דוגמאות, מעקב אחר הנחיות מדויקות עם 160 דוגמאות, מתמטיקה עם 183 דוגמאות, בטיחות עם 450 שאלות, מיקוד בנושא עם 495 דוגמאות, ותחום חדש בשם שוויונות שבוחן 102 מקרים שבהם יש כמה תשובות נכונות אפשריות.

מרבית הפרומפטים נאספו מבני אדם, למעט קטגוריית הבטיחות שמבוססת על CoCoNot והשוויונות שנבנו ידנית. התשובות נוצרו משורה ארוכה של מודלים מובילים, בהם גרסאות שונות של Llama, משפחת Qwen, מודלי Tulu, וגם מודלים סגורים כמו GPT-4o ו־Claude 3.5 Sonnet. סינון התשובות השתנה לפי התחום: מודלי שופט עבור עובדות ובטיחות, פונקציות אימות למעקב הנחיות, והצבעת רוב בחישובי מתמטיקה.

מתאים ל

  • הערכת מודלי תגמול

    מדידת הדיוק של מודל תגמול בזיהוי התשובה הטובה מתוך ארבע אפשרויות.

  • בדיקת חוסן במתמטיקה ועובדות

    בחינת היכולת של המערכת לסנן הזיות וטעויות חישוב מורכבות.

  • מדידת עמידה בהנחיות

    בדיקה אם המודל מזהה תשובות שנכשלו באילוצים קשיחים כמו הימנעות מאות מסוימת.

איפה זה נופל

המאגר כולו מוגבל לשפה האנגלית בלבד, ואין בו שום ייצוג לעברית או לשפות אחרות. מעבר לזה, רבות מהתשובות סוננו בעזרת מודלי שפה כשופטים, מה שעלול לשמר הטיות מובנות של אותם מודלים בהערכת איכות. אם אתם בונים מודל דירוג לשירות ישראלי או למערכת רב לשונית, המאגר הזה יבדוק רק את היכולת הלוגית באנגלית ולא יעיד דבר על הביצועים בשפת היעד שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון של המאגר הוא ODC-BY שדורש ייחוס בלבד, אך הוא מיועד לפי החוקרים למחקר וחינוך. בנוסף, הדאטהסט כולל פלטים של מודלים כמו GPT-4o ו־Claude 3.5 Sonnet שמגיעים עם הגבלות שימוש מסחריות משלהם.

האם הדאטהסט מתאים להערכת מודלים בעברית?

לא. כל הנתונים, הפרומפטים והתשובות במאגר כתובים באנגלית בלבד. כדי לבדוק מודל תגמול בעברית תצטרכו להשתמש במקורות אחרים או לתרגם את המבחנים.

איך נאספו התשובות שנפסלו?

החוקרים הריצו פרומפטים על עשרות מודלים שונים ויצרו מגוון תשובות. לאחר מכן הם סיננו את התשובות באמצעות שופטי שפה אוטומטיים, פונקציות אימות קוד והצבעת רוב במתמטיקה כדי לוודא מה נכון ומה נדחה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה allenai/reward-bench-2, ללא צורך באישור גישה מראש. המאגר מגיע כקובץ Parquet יחיד בשם test-00000-of-00001.parquet ומכיל בין אלף לעשרת אלפים רשומות, כך שהוא יורד ונטען תוך שניות בודדות. השדות המרכזיים לעבודה הם prompt, הרשימות chosen ו־rejected, ושם הקטגוריה בשדה subset שמאפשר לסנן תחום ספציפי.

from datasets import load_dataset

ds = load_dataset("allenai/reward-bench-2")

הרישיון

המאגר מופץ תחת רישיון ODC-BY, שמתיר שימוש ומחקר בתנאי שנותנים קרדיט מתאים ליוצרים. עם זאת, התוכן כולל פלטים שנוצרו ישירות ממודלים מסחריים כמו GPT-4o ו־Claude 3.5 Sonnet וכן ממודלים בעלי רישיונות ייעודיים כמו Deepseek ו־Llama. המשמעות היא שתנאי השימוש של אותן חברות עשויים להגביל אימון מודלים מסחריים מתחרים על גבי הדאטה הזה.

הרישיון המלא ב־Hugging Face ↗