GPT
A

arena-human-preference-55k

קוד פתוח

lmarena-aiapache-2.02024-05-02

המאגר כולל שיחות אמיתיות בין אנשים למודלי שפה שונים, יחד עם הצבעה מי ניצח. הוא נועד לאימון מודלים שמנחשים העדפות אנושיות.

  • 2,182הורדות בחודש
  • 159לייקים

מה זה

הנתונים מגיעים מתוך זירת הקרבות של Chatbot Arena, ונבנו עבור תחרות Kaggle. יש כאן יותר מ־55,000 קרבות שבהם משתמשים שאלו שאלה, קיבלו שתי תשובות עיוורות משני מודלים שונים, ובחרו מי ענה טוב יותר.

כל שורה כוללת את השאלה המקורית, את התשובות של שני המודלים, ואת הבחירה של המשתמש. התיוג מוגדר באחת מארבע אפשרויות: עדיפות למודל הראשון, עדיפות לשני, תיקו שבו שניהם היו טובים, או תיקו שבו שניהם נכשלו. המודלים שנבדקו כוללים מעל 70 מודלים מובילים, בהם גרסאות של GPT-4, קלוד 2, לאמה 2, ג'מיני ומיסטרל.

מתאים ל

  • אימון מודל דירוג

    לימוד מודל לתת ציון לתשובות שונות על פי העדפות של אנשים אמיתיים.

  • פיתוח מודל שופט

    בניית מערכת שמשווה בין פלטים של שני מודלים ובוחרת את המנצח.

  • מחקר על החלטות משתמשים

    ניתוח המאפיינים שגורמים לאנשים להעדיף תשובה של מודל מסוים.

איפה זה נופל

הנתונים מוגדרים באנגלית בלבד. אם אתם בונים משהו שמיועד לעברית, המאגר הזה לא יעזור לכם בלי תרגום או התאמות כבדות. מעבר לזה, מדובר בהצבעות של משתמשי אינטרנט מזדמנים, כך שיש שם הטיות סובייקטיביות, שאלות מוזרות ותשובות שלא תמיד נבדקו לעומק על ידי מומחי תוכן. בנוסף, מדובר במודלים ובגרסאות שהיו זמינים עד מאי 2024.

אותה משפחה

arena-human-preference יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המאגר כולל שיחות בעברית?

לא, הדאטהסט מוגדר רשמית עבור השפה האנגלית בלבד. ייתכן שיש שם דוגמאות בודדות של משתמשים שכתבו בעברית, אבל זה לא חלק מהייעוד שלו ולא הייתי בונה על זה למודל מקומי.

האם מותר להשתמש בזה לפיתוח מוצר מסחרי?

כן, רישיון Apache 2.0 מאפשר שימוש מסחרי מלא. אתם יכולים לאמן מודלים על הנתונים האלה ולשלב אותם במוצרים מסחריים, כל עוד אתם שומרים על תנאי הייחוס של הרישיון המקורי.

מה מייחד את הנתונים האלה בהשוואה לדאטהסטים אחרים?

הייחוד הוא שהשאלות נכתבו על ידי אנשים אמיתיים בזמן אמת ולא נוצרו באופן סינתטי. בנוסף, ההשוואה היא ראש בראש בין מעל 70 מודלים שונים, עם תיוג ישיר של העדפת המשתמש שכולל גם מצבי תיקו.

איך טוענים

המאגר יושב כקובץ train.csv פשוט, כך שלא צריך להתעסק עם מבנים מסובכים. הגישה חופשית לגמרי בלי צורך לבקש אישור מיוחד. אתם טוענים אותו ישירות דרך הספרייה של Hugging Face או קוראים את ה־CSV עם pandas, ובודקים בעיקר את עמודות הפרומפט, תשובות המודלים ותוצאת ההצבעה.

from datasets import load_dataset

ds = load_dataset("lmarena-ai/arena-human-preference-55k")

הרישיון

הרישיון כאן הוא Apache 2.0. מותר להשתמש בנתונים לצרכים מסחריים, לשנות אותם ולאמן עליהם מודלים בלי לחלוק את קוד המקור שלכם. התנאי העיקרי הוא שמירה על הודעת הרישיון ומתן קרדיט ליוצרים לפי הציטוט שמופיע בתיעוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗