GPT
L

leaderboard-dataset

קוד פתוח

lmarena-aicc-by-4.02026-04-02

המאגר מרכז צילומי מצב היסטוריים של לוחות התוצאות מתוך Arena. הוא מיועד למי שחוקר ביצועי מודלים לאורך זמן ורוצה לעקוב אחרי דירוגים וציונים רשמיים במגוון תחומים.

  • 28,582הורדות בחודש
  • 24לייקים

מה זה

הרשומות מייצגות נתוני דירוג של מודלים שפורסמו לאורך הזמן בלוחות התוצאות של Arena, ולא את פרומפטי המשתמשים או השיחות עצמן. המאגר מכיל תתי מאגרים לפי זירות פעילות שונות, כולל טקסט, ראייה ממוחשבת, חיפוש, מסמכים, פיתוח ווב, יצירה ועריכה של תמונות ווידאו, לצד זירת סוכנים ייעודית. בזירות מסוימות יש תתי מאגרים נוספים עם בקרת סגנון.

המבנה מחולק לשני פיצולים, כשרשומות ה־full כוללות את כל לוחות התוצאות שפורסמו היסטורית, ורשומות ה־latest מציגות רק את הפרסום העדכני ביותר. הנתונים מגיעים ישירות מעדכוני המערכת של האתר לאורך תקופות שונות, החל מחישובים מוקדמים ועד תוספות מאוחרות יותר כמו נתוני סוכנים וחיפוש.

מתאים ל

  • ניתוח מגמות של מודלים

    מעקב היסטורי אחרי השינויים בדירוגים ובציונים של מודלים שונים לאורך תקופות זמן לפי נתוני לוחות התוצאות.

  • השוואת ביצועי סוכנים

    בדיקת מדדי IPS של סוכנים סביב התנהגויות מוגדרות כמו שגיאות פקודה, הזיות כלים ועמידה בהנחיות.

  • בחינת שינויי מתודולוגיה

    מחקר על השפעת שיטות חישוב כמו Bradley-Terry ובקרת סגנון על יציבות הציונים ודירוג המודלים.

איפה זה נופל

הנתונים לא מתאימים לאימון של מודלי שפה, כי אין בהם טקסטים או תשובות אלא רק שורות סטטיסטיות על ביצועים. מי שמשווה ציונים היסטוריים חייב לשים לב לשינויי המתודולוגיה של המערכת. ב־9 בינואר 2024 עברו משיטת Elo למודל Bradley-Terry, ב־16 במאי 2025 בקרת הסגנון הפכה לברירת המחדל בטקסט וראייה, וב־23 ביולי 2025 הופעל שקלול מחדש לפי תדירות.

בנוסף, זירות שונות התחילו בתאריכים שונים לגמרי. נתוני חיפוש מתחילים באוגוסט 2025, פיתוח ווב בנובמבר 2025, וזירת הסוכנים מתחילה רק ביוני 2026, כך שאי אפשר להשוות רצף זמנים זהה בין כל התחומים.

שאלות
נפוצות

האם מותר להשתמש בנתונים לפרויקט מסחרי?

כן, הרישיון המדווח הוא cc-by-4.0 שמתיר שימוש מסחרי מלא. הדרישה העיקרית היא מתן קרדיט וייחוס הולם ליוצרי המאגר.

האם המאגר כולל שיחות או פרומפטים בעברית?

לא, המאגר לא מכיל שיחות, טקסטים או פרומפטים בכלל, אלא רק מטא-דאטה וציונים מספריים מתוך לוחות התוצאות. המידע היחיד לגבי המודלים הוא מזהים, שיוך ארגוני, סוג הרישיון והתוצאות הסטטיסטיות שקיבלו.

איך נאספו הנתונים שבמאגר?

הנתונים נשמרו כצילומי מצב תקופתיים ישירות מפרסומי לוחות התוצאות של Arena בתאריכים שונים. הם מבוססים על חישובי הצבעות משתמשים לפי מתודולוגיות מתחלפות לאורך השנים.

האם אפשר להשתמש במאגר כדי לאמן מודל שפה?

המאגר לא מתאים לאימון מודלים של יצירת שפה או פתרון משימות, כי הוא מכיל נתוני טבלאות בלבד על ביצועי מודלים. הוא מיועד לניתוח סטטיסטי, מחקר על הערכת מודלים או מעקב אחר השוק.

איך טוענים

הנתונים מחולקים ל־46 קבצים בפורמט Parquet לפי תתי מאגרים, כך שניתן לטעון קובץ בודד של התחום הרלוונטי או את המאגר כולו. אין צורך לבקש אישור גישה מיוחד כדי להוריד את הקבצים.

רוב התחומים כוללים שדות כמו שם המודל, הארגון, הרישיון שלו, הדירוג, רווחי סמך, שונות, כמות ההצבעות והתאריך. בתת המאגר של הסוכנים הסכמה שונה ומבוססת על ציוני IPS, רווחי סמך תואמים ומספר תצפיות או סשנים במקום הצבעות רגילות.

from datasets import load_dataset

ds = load_dataset("lmarena-ai/leaderboard-dataset")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שנותנים ייחוס מתאים למפרסמים. אין כאן דרישה לשתף נגזרות תחת אותו רישיון. אם אתם בונים כלי ניתוח או מציגים את הנתונים, מספיק לציין את המקור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗