GPT
M

mt_bench_human_judgments

קוד פתוח

lmsyscc-by-4.02023-07-04

המאגר מרכז 3.3K השוואות איכות בין תשובות של שישה מודלים שונים לשמונים שאלות מורכבות. הוא מיועד למי שרוצה לבדוק התאמה בין שיפוט אנושי לשיפוט אוטומטי של מודל שופט.

  • 2,333הורדות בחודש
  • 147לייקים

מה זה

הנתונים כוללים כ־3,300 הכרעות של מעריכים אנושיים בין זוגות תשובות שנכתבו על ידי שישה מודלים: GPT-4, GPT-3.5, Claude-v1, לצד גרסאות Vicuna-13B, Alpaca-13B ו־LLaMA-13B. כל המודלים ענו על שמונים שאלות מתוך מבחן MT-bench שמכסות שיחה ומענה על שאלות. המעריכים שביצעו את ההשוואות היו ברובם סטודנטים לתארים מתקדמים בעלי מומחיות בתחומי הידע של השאלות שנבדקו.

המבנה הפנימי במאגר מחולק לקובצי פרקט. יש קובץ ייעודי לשיפוט האנושי, human, ולצידו קובץ נפרד שמציג את ההערכות המקבילות שנוצרו על ידי GPT-4 כמודל שופט, gpt4_pair. הפיצול הזה מאפשר לבחון בצורה ישירה את מידת ההסכמה בין הציונים שנתנו בני האדם לבין ההחלטות שקיבלה המכונה בכל זוג תשובות.

מתאים ל

  • כיול מודל שופט

    בדיקת ההסכמה בין שיפוט אוטומטי לבין הכרעות של מומחים אנושיים.

  • השוואת מודלים ותיקים

    מדידת ביצועים היסטוריים של מודלים משנת 2023 על שאלות MT-bench.

  • אימון מודלי תגמול

    שימוש בזוגות ההעדפה כחלק מבדיקות ראשוניות לאימון מודלי reward.

איפה זה נופל

ההערכות מתבססות כולן על שמונים שאלות בלבד ובשפה האנגלית, כך שאין כאן שום מידע על ביצועים בעברית או במשימות מקומיות. מעבר לזה, המודלים שנבדקו מייצגים את אמצע שנת 2023, וחלקם כבר נחשבים ישנים מאוד. כמות הדגימות מוגבלת ל־3,300 השוואות, מה שהופך את המאגר לכלי בדיקה ומחקר בלבד ולא לחומר גלם שמספיק לאימון מודל חדש.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, רישיון CC-BY 4.0 מאפשר שימוש מסחרי מלא. אתם רק חייבים לציין את הקרדיט לצוות של lmsys שפרסם את הנתונים.

האם יש במאגר דוגמאות בעברית?

לא. כל השאלות והתשובות בדאטהסט כתובות באנגלית בלבד. אם אתם בונים שירות לשפה העברית, תצטרכו לאסוף הערכות מקומיות בעצמכם.

מי האנשים שדירגו את התשובות בפועל?

לפי כרטיס הדאטהסט והמאמר הנלווה, רוב המדרגים היו סטודנטים לתארים מתקדמים בעלי מומחיות בתחומי השאלות שנבדקו. הדירוג התבצע בצורה של העדפה בין שני פלטים במקביל.

באיזה פורמט המידע שמור וכמה הוא כבד?

המאגר כולל ארבעה קבצים והנתונים שמורים בקובצי פרקט. מכיוון שיש בו רק כ־3,300 רשומות, נפח ההורדה זניח והוא יורד תוך שניות בודדות.

איך טוענים

אתם מושכים את הקבצים ישירות מספרית datasets באמצעות שם המאגר lmsys/mt_bench_human_judgments. המאגר כולל ארבעה קבצים בלבד, ביניהם קובצי פרקט קטנים, ולכן הוא נטען בשניות בודדות בלי שום צורך באישור גישה מיוחד. בתוך המידע תמצאו בעיקר את השאלות, זוגות הפלטים של המודלים, זהות המודלים שנבדקו וההכרעה של המעריך לגבי התשובה העדיפה.

from datasets import load_dataset

ds = load_dataset("lmsys/mt_bench_human_judgments")

הרישיון

הרישיון הוא CC-BY 4.0 שמתיר שימוש מסחרי, שינוי והפצה של המידע. הדרישה היחידה היא לתת קרדיט ברור ליוצרים המקוריים של lmsys, ללא חובה להפיץ פרויקטים נגזרים באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗