GPT
S

Skywork-Reward-Preference-80K-v0.2

קוד פתוח

Skyworkרישיון לא דווח2024-10-11

אוסף של כ־80 אלף זוגות העדפה לאימון מודלי תגמול, שעבר ניקוי מזיהומים מול מבחן ההערכה RewardBench. המטרה כאן היא לתת בסיס נקי יותר להשוואת ביצועים אמינה בלי זליגת נתונים.

  • 1,269הורדות בחודש
  • 70לייקים

מה זה

המאגר מכיל זוגות העדפה שנבחרו בקפידה מתוך מקורות ציבוריים מוכרים כמו HelpSteer2, OffsetBias, WildGuard וסדרת Magpie DPO. היוצרים לא שינו את הנתונים המקוריים עצמם, אלא ביצעו דגימת משנה וסינון חכם כדי לחזק יכולות ספציפיות בתחומי מתמטיקה, קוד, צ'אט ובטיחות.

הסינון כלל בחירת דוגמאות מובילות ממאגרי Magpie לפי ציוני מודל ArmoRM, תוך מתן עדיפות לתת-מאגרים איכותיים יותר. עבור דוגמאות הבטיחות והיריבות מתוך WildGuard, החוקרים אימנו תחילה מודל תגמול על שאר המקורות, ניקדו בעזרתו את התשובות, והכניסו למאגר רק דוגמאות שבהן התשובה הנבחרת אכן קיבלה ציון גבוה מהתשובה שנדחתה. גרסה זו מסירה 4,957 זוגות שהכילו חפיפה גבוהה עם פרומפטים של RewardBench.

מתאים ל

  • אימון מודלי תגמול

    בסיס נתונים מעורב ומסונן היטב לאימון מודל reward שמיועד לתהליכי RLHF ויישור מודלי שפה.

  • הערכה נקייה מול בנצ'מרק

    בדיקת איכות מודלים מול RewardBench ללא חשש מזיהום נתונים שפגע בגרסה הקודמת של האוסף.

  • אימון יישור בטיחות

    שימוש בזוגות היריבות המסוננים מתוך WildGuard כדי ללמד מודלים לדחות בקשות מסוכנות בלי לפגוע בהיגיון.

איפה זה נופל

המאגר מבוסס כולו על דגימת מקורות קיימים באנגלית, ואין בו שום התייחסות לעברית או לשפות נוספות. הסינון של WildGuard נשען על ציון שנתן מודל תגמול בגודל 27B, מה שעלול לקבע הטיות פנימיות של אותו מודל בבחירת מה נחשב בטוח או רצוי. בנוסף, למרות הניקוי היסודי מול RewardBench, ההסתמכות על מודלים אוטומטיים כמו ArmoRM לדירוג איכות עלולה להחמיץ כשלים אנושיים עדינים.

אותה משפחה

Skywork-Reward-Preference יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

בדף המאגר לא הוגדר רישיון רשמי. המשמעות היא שאין הרשאה מפורשת לשימוש מסחרי, ומומלץ לבדוק את תנאי הרישיונות של מקורות המקור כמו HelpSteer2 ו־Magpie לפני שמתחילים לאמן.

האם יש בדאטהסט תמיכה בעברית?

לא. הנתונים מבוססים על מאגרים ציבוריים באנגלית בלבד. לא כדאי להסתמך עליו לאימון יכולות העדפה או שפיטה בשפה העברית.

מה ההבדל בין גרסה v0.2 לגרסה v0.1?

בגרסה v0.2 הוסרו 4,957 זוגות מתת המאגר magpie-ultra שהכילו חפיפת טקסט משמעותית עם מבחן ההערכה RewardBench. אם אתם מתכננים למדוד ביצועים על המבחן הזה, הגרסה הנוכחית מונעת עיוות של התוצאות.

איך נאספו וסוננו הנתונים?

החוקרים לקחו כ־80 אלף דוגמאות ממאגרים קיימים ללא שינוי הטקסט עצמו. הסינון בוצע באמצעות ציוני מודל ArmoRM לתחומי קוד ומתמטיקה, וסינון נתוני בטיחות באמצעות מודל תגמול ייעודי בגודל 27B.

איך טוענים

הנתונים יושבים בקובץ Parquet יחיד בשם train-00000-of-00001.parquet תחת תיקיית data, לצד קובץ התיעוד. הגישה למאגר פתוחה לחלוטין ואינה דורשת אישור מיוחד מצד Skywork. אפשר לטעון אותו ישירות דרך ספריית datasets הרגילה של Hugging Face כדי לעבוד עם השדות של זוגות ההעדפה שכוללים את הפרומפט, התשובה שנבחרה והתשובה שנדחתה.

from datasets import load_dataset

ds = load_dataset("Skywork/Skywork-Reward-Preference-80K-v0.2")

הרישיון

היוצרים לא דיווחו על רישיון כלל בכרטיס המאגר. מבחינה משפטית, היעדר רישיון משאיר את זכויות השימוש מעורפלות לגמרי, במיוחד עבור מוצרים מסחריים. כיוון שהנתונים נדגמו מכמה מאגרים חיצוניים שונים כמו HelpSteer2 ו־WildGuard, חייבים לבדוק בנפרד את תנאי הרישיון המקוריים של כל מקור ומקור לפני שמשלבים מודל שאומן עליהם במערכת פעילה.

הרישיון המלא ב־Hugging Face ↗