GPT
A

arena-human-preference-140k

קוד פתוח

lmarena-aicc-by-4.02025-08-01

המאגר מרכז הצבעות אנושיות אמיתיות שהשוו בין שני מודלים שונים בשיחות טקסט חופשיות. הוא נותן בסיס ישיר לאימון מודלי תגמול או לכיול העדפות לפי שיפוט של משתמשים.

  • 2,534הורדות בחודש
  • 55לייקים

מה זה

כל שורה מייצגת הצבעה של משתמש שבחן תשובות של שני מודלים עיוורים, מודל א' ומודל ב', על אותה שיחה. הנתונים נאספו במסגרת קטגוריית הטקסט של הפלטפורמה וכוללים את היסטוריית השיחה המלאה לצד מטא דאטה טכני. המאגר כולל תיוגים נושאיים כמו מתמטיקה, כתיבה יצירתית, כתיבת קוד, מעקב אחר הוראות ושאלות קשות.

המבנה שומר על הקשר רחב. השדה של השיחה המלאה מציג את כל שלבי השיחה הקודמים, כשבכל שלב נדגמו מודלים שונים. השדות כוללים גם ספירת טוקנים, שימוש במארקדאון ותוצאת השיפוט שקובעת מי ניצח, האם נרשם תיקו או ששני המודלים נתנו מענה גרוע.

מתאים ל

  • אימון מודלי תגמול

    לימוד דירוג תשובות לפי בחירות אנושיות עבור תהליכי RLHF ויישור מודלים.

  • סינון לפי מיומנויות

    שליפת דוגמאות ממוקדות לפי תיוגים מוגדרים של מתמטיקה, כתיבת קוד או שאלות קשות.

  • ניתוח העדפות עיצוב

    בדיקת הקשר בין אורך התשובה ועיצוב מארקדאון לבין סיכויי הזכייה בקרב.

איפה זה נופל

הכרטיס לא מפרט פילוח שפות, כך שאין שום הבטחה לייצוג של עברית או לנפח שאילתות מקומי. בנוסף, לא מוסבר אילו סינונים או ניקויים בוצעו על הטקסטים שהזינו המשתמשים, מה שעלול להשאיר רעש, שגיאות או מידע רגיש. נקודה מהותית נוספת היא שבהיסטוריית השיחה המורחבת מגיבים מודלים שונים בכל שלב, מה שמקשה על ניתוח עקביות של מודל יחיד לאורך זמן.

אותה משפחה

arena-human-preference יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המוצהר הוא cc-by-4.0, אבל הכרטיס מציין שתשובות המודלים כפופות לתנאי השימוש של ספקי המודלים עצמם. אם ספק מקורי אוסר לאמן מודלים מתחרים על הפלטים שלו, השימוש המסחרי בעייתי.

האם יש במאגר שיחות בעברית?

התיעוד לא מפרט חלוקה גיאוגרפית או שפתית. המאגר נאסף באינטרנט פתוח אך ללא מידע מפורש על עברית, סביר שרובו המוחלט באנגלית ודרוש סינון ידני כדי לאתר טקסט מקומי.

איך נאספו הנתונים שבפנים?

הנתונים מגיעים מהצבעות של משתמשים שהשוו בין שני מודלים עיוורים בזמן אמת. כל שורה מייצגת הכרעה אנושית לגבי המודל המוביל או קביעה של תיקו על גבי שיחה מרובת שלבים.

איך טוענים

הנתונים מחולקים לשבעה קובצי parquet תחת תיקיית המידע ומגיעים כספליט יחיד של אימון. אין צורך בבקשת גישה מיוחדת, טוענים ישירות דרך ספריית datasets באמצעות המזהה lmarena-ai/arena-human-preference-140k. בעבודה איתו כדאי לפרוס תחילה את conversation_a ו conversation_b ולבדוק את שדה winner, תוך התחשבות בכך ש full_conversation מערבב כמה מודלים שונים באותו רצף של סשן מתמשך.

from datasets import load_dataset

ds = load_dataset("lmarena-ai/arena-human-preference-140k")

הרישיון

הרישיון הרשמי הוא cc-by-4.0, שמתיר שימוש מסחרי ושינויים בכפוף למתן קרדיט. עם זאת, יש כאן מלכודת משפטית. הכרטיס מבהיר שהרישיון תופס לפרומפטים של המשתמשים, בעוד שתשובות המודלים כפופות לתנאי השימוש של החברות שיצרו אותם. אימון מודל מסחרי עלול להיתקל במגבלות של ספקיות ה LLM המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗