GPT
A

arena-human-preference-100k

קוד פתוח

lmarena-aiרישיון לא דווח2025-02-04

שיחות אמיתיות מתוך זירת ההשוואה של מודלי שפה, יחד עם הבחירות של המשתמשים בשאלה איזה מודל ענה טוב יותר. המאגר נותן תמונת מצב ישירה של העדפות אנושיות, בלי סינון מעבדתי סטרילי.

  • 935הורדות בחודש
  • 49לייקים

מה זה

הנתונים מבוססים על אינטראקציות חיות שנאספו בין יוני 2024 לאוגוסט 2024 בתוך הצ'אטבוט ארנה, שם אנשים כותבים פרומפטים ומקבלים שתי תשובות אנונימיות ממודלים מתחרים. המאגר כולו ממוקד בשיחות בשפה האנגלית וכולל את תוצאות ההעדפה האנושית ששימשו לבניית כלי הניתוח ארנה אקספלורר. כל רשומה מייצגת התמודדות ראש בראש סביב שאלה או בקשה מסוימת.

בנוסף לקובץ השיחות עצמו, המפרסמים צירפו קובץ אמבדינגס מוכן שנבנה מראש על גבי הטקסטים באנגלית. המטרה של הווקטורים האלה היא להזין תהליכי מידול נושאים, מה שמאפשר לחלק את השיחות לקטגוריות תוכן שונות ולנתח באילו תחומים מודלים מסוימים מנצחים ובאילו הם מתקשים.

מתאים ל

  • אימון מודלי תגמול

    טיוב והתאמה של מודלי שפה בעזרת העדפות אנושיות ישירות מתוך השוואות ראש בראש.

  • מידול נושאי שיחה

    ניתוח תחומי העניין של משתמשים בעזרת קובץ האמבדינגס המצורף.

  • הערכת ביצועי מודלים

    בדיקה אילו סוגי תשובות זוכים להעדפה מול קהל משתמשים אמיתי באנגלית.

איפה זה נופל

ההטיה הכי גדולה כאן היא השפה. המאגר כולל שיחות באנגלית בלבד, כך שאין כאן שום ייצוג לעברית, לא ברמת הטקסטים ולא ברמת ההעדפות של דוברי השפה. בנוסף, חלון הזמן מוגבל מאוד, שלושה חודשים בלבד בקיץ 2024. תחום ה־LLM משתנה מהר, ומודלים שהתחרו שם כבר קיבלו גרסאות חדשות. הנתונים מגיעים ממשתמשי אינטרנט שבחרו להיכנס לזירה, מה שאומר שהפרומפטים מוטים לבדיקות השוואתיות ולא בהכרח מייצגים שימוש עסקי יומיומי.

אותה משפחה

arena-human-preference יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

זה בעייתי מבחינה משפטית. בעוד שהשאלות הן ברישיון פתוח, התשובות שייכות לתנאי השימוש של ספקי המודלים השונים, ולכן לא הייתי בונה על זה מוצר מסחרי בלי בדיקה משפטית של כל מודל שמופיע שם.

האם הדאטהסט כולל שאלות ותשובות בעברית?

לא. הכרטיס מציין במפורש שהנתונים והווקטורים שנוצרו עבורם כוללים שיחות באנגלית בלבד שנאספו בזירה.

איך הנתונים נאספו בפועל?

המידע מגיע ממשתמשים שנכנסו לאתר הצ'אטבוט ארנה בין יוני לאוגוסט 2024. המשתמשים הזינו פרומפטים, קיבלו שתי תשובות ממודלים אנונימיים, ובחרו את התשובה הטובה בעיניהם.

מה התפקיד של קובץ ה־npy שנמצא במאגר?

הקובץ מכיל וקטורים שמייצגים את השיחות באנגלית, שחושבו מראש לצורך מידול נושאים. אפשר להשתמש בו ישירות לניתוח אשכולות בלי להריץ מודל אמבדינגס מאפס.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטס מתוך הנתיב lmarena-ai/arena-human-preference-100k, ללא צורך בהרשאת גישה מיוחדת או אישור ידני. הנתונים עצמם שמורים בקובץ arena-explorer-preference-100k.parquet, ולצידו נמצא קובץ embeddings.npy בנפרד. לפני שרצים לאמן, צריך להביא בחשבון שהאמבדינגס שמורים במערך נמפיי חיצוני, כך שצריך לטעון אותם בנפרד אם רוצים לקשר בין הטקסט לוקטור שלו. השדות המרכזיים כוללים את תוכן השיחות באנגלית, את תשובות המודלים ואת ההכרעה האנושית ביניהן.

from datasets import load_dataset

ds = load_dataset("lmarena-ai/arena-human-preference-100k")

הרישיון

המצב המשפטי כאן מורכב ומחייב זהירות. הפרומפטים של המשתמשים מופצים תחת רישיון CC-BY-4.0 שדורש ייחוס, אבל התשובות של המודלים כפופות לתנאי השימוש של החברות שיצרו אותם. מכיוון שאין רישיון אחיד ברמת המאגר, שימוש מסחרי במודל שיאומן על הנתונים האלה עלול להפר את תנאי השירות של ספקי המודלים המקוריים.

הרישיון המלא ב־Hugging Face ↗