GPT
H

HelpSteer

קוד פתוח

nvidiacc-by-4.02023-11-15

  • human-feedback

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

המאגר מכיל עשרות אלפי זוגות של שאלות ותשובות שמדורגות על פי חמישה מאפיינים נפרדים. זה פתרון למי שרוצה לאמן מודל שיודע לשלוט ברמת הפירוט והעומק של הטקסט ולא רק לקבל ציון כללי.

  • 3,075הורדות בחודש
  • 252לייקים

מה זה

הנתונים כוללים 37,120 רשומות שמחולקות בין קובץ אימון של 35,331 דוגמאות לקובץ ולידציה של 1,789 דוגמאות. כל רשומה מורכבת מהנחיה, תשובה של מודל שפה, וחמישה ציונים מ־0 עד 4 שקבעו מעריכים אנושיים: מועילות, נכונות עובדתית, קוהרנטיות, מורכבות ואריכות.

השאלות נאספו מתבניות או נכתבו על ידי עובדי חברת Scale AI, ומכסות משימות של סיכום, שכתוב, סיווג, חילוץ מידע, מענה על שאלות וסיעור מוחות. התשובות הופקו מגרסה מוקדמת של מודל פנימי של אנבידיה, עם עד ארבע תשובות לכל הנחיה כדי ליצור גיוון.

התיוג נעשה על ידי כ־200 מעריכים מארצות הברית שעברו מבחני שליטה באנגלית והכשרה עם מבחן מעשי. בקרת האיכות כללה לפחות שתי בדיקות אנושיות ובדיקות אוטומטיות של Scale AI, ולאחר מכן סינון נוסף של אנבידיה שהשאיר רק את הדוגמאות שעמדו ברף.

מתאים ל

  • אימון SteerLM מותנה

    כוונון עדין של מודלים להתאמת רמת המורכבות ואורך התשובה לדרישת המשתמש.

  • מודל תגמול לתיוג איכות

    אימון מודל דירוג שמזהה תשובות נכונות, קוהרנטיות ומועילות מתוך מספר אפשרויות.

  • הערכת ביצועי מודלי שפה

    בדיקת איכות התשובות של מודל מול דוגמאות מגוונות ומדורגות בקובץ הבדיקה.

איפה זה נופל

החיסרון הברור הוא השפה: כל הטקסטים באנגלית בלבד ומבוססים על מעריכים מארצות הברית, בלי ייצוג לעברית או תרבויות אחרות. התשובות נוצרו על ידי מודל פנימי ישן של אנבידיה בסוף 2023, והמפרסמים עצמם מציינים מפורשות שעדיף להשתמש בגרסת ההמשך, HelpSteer2, ולא במאגר הזה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא cc-by-4.0, ומאפשר שימוש מסחרי מלא באימון מודלים ובפיתוח מערכות, כל עוד נותנים ייחוס מתאים למחברים.

האם יש במאגר שאלות או תשובות בעברית?

לא. כל הנתונים נאספו ותויגו באנגלית בלבד על ידי מעריכים דוברי אנגלית מארצות הברית. כדי להשתמש בו למודלים בעברית תצטרכו לתרגם את הנתונים או להשתמש בו רק להעברת יכולות.

במה הוא שונה ממאגרי העדפות רגילים כמו של RLHF?

במקום לתת העדפה יחסית בין שתי תשובות, המאגר מספק חמישה ציונים מוחלטים ונפרדים לכל תשובה. הפיצול הזה מאפשר לאמן מודלים ששולטים בתכונות ספציפיות כמו רמת פירוט או מורכבות.

למה אנבידיה ממליצה להשתמש ב־HelpSteer2 במקום בזה?

החוקרים הוציאו גרסה שנייה שמשפרת את הנתונים ומתקנת ליקויים מהגרסה הראשונה. אם אתם מתחילים פרויקט חדש עכשיו, עדיף לפנות ישירות לגרסה המעודכנת לפי המלצתם.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face בלי צורך בהרשאות גישה או אישור מיוחד. הנתונים מגיעים בקבצי jsonl.gz מכווצים ומסודרים מיד לחלוקת train ו־validation. המבנה פשוט מאוד: מחרוזת prompt, מחרוזת response, וחמשת השדות המספריים עם הציונים, כך שאין צורך לבצע עיבוד מוקדם כבד.

from datasets import load_dataset

ds = load_dataset("nvidia/HelpSteer")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0 שמתיר שימוש מסחרי, שינוי ושיתוף של הנתונים, כולל אימון מודלים למוצרים מסחריים. התנאי היחיד הוא מתן קרדיט ברור לחוקרים ולאנבידיה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗