GPT
L

lex_glue

קוד פתוח

coastalcphcc-by-4.02022-03-02

בנצ'מרק שמקבץ שבע משימות שונות מעולם המשפט באנגלית, מסיווג סעיפים ועד שאלות אמריקאיות. הוא מתאים למי שרוצה לבדוק אם מודל שפה באמת מתמודד עם טקסטים משפטיים כבדים.

  • 22,376הורדות בחודש
  • 83לייקים

מה זה

המאגר מורכב משבעה תתי מאגרים נפרדים, כולם מבוססי טקסטים משפטיים אמיתיים שפושטו כדי לאפשר הערכה אחידה. הוא כולל תביעות מבית הדין האירופי לזכויות אדם, החלטות של בית המשפט העליון בארצות הברית, חקיקה אירופית ממאגר יורולקס, סעיפי חוזים מדווחי רשות ניירות הערך האמריקאית, ניתוח תנאי שימוש באתרים, ומבחן הבנה המבוסס על פסיקות מאוניברסיטת הרווארד.

כל תת מאגר מטפל במשימה אחרת. יש כאן סיווג רב מחלקתי של נושאים, סיווג רב תוויות של הפרות זכויות או מושגים משפטיים, ומשימת מענה על שאלות אמריקאיות שבה המודל צריך לבחור את התקדים הנכון מתוך חמש אפשרויות. המבנה הפנימי משתנה בהתאם: בחלק מהמשימות הקלט הוא פסקה בודדת, ובאחרות רשימת עובדות או פסק דין שלם.

מתאים ל

  • הערכת מודלי שפה

    בדיקת ביצועים של מודלים כלליים או ייעודיים על מגוון רחב של משימות משפטיות באנגלית.

  • סיווג אוטומטי של חוזים

    אימון מודל לזיהוי נושאים בסעיפים חוזיים על בסיס נתוני דיווחי חברות ציבוריות.

  • בדיקת תנאי שימוש

    זיהוי סעיפים בעייתיים או לא הוגנים בהסכמי משתמש של אתרים ואפליקציות.

איפה זה נופל

הנתונים כולם באנגלית בלבד, ומתמקדים אך ורק בדין האמריקאי ובמשפט האירופי. אם אתם בונים כלי למערכת המשפט הישראלית או לחוזים בעברית, המאגר הזה לא ייתן לכם כמעט כלום מעבר לבדיקת יכולת ההסקה הכללית של המודל. בנוסף, המשימות עברו פישוט מכוון כדי להתאים למודלים כלליים, כך שהן לא מייצגות את מלוא המורכבות של עבודה משפטית אמיתית בשטח.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא. כל שבע המשימות מבוססות על טקסטים באנגלית בלבד ממקורות אמריקאיים ואירופיים. הוא אינו מכיל פסקי דין או חוזים מהדין הישראלי.

האם מותר להשתמש בדאטהסט לפיתוח מודל מסחרי?

כן, הרישיון המדווח הוא CC BY 4.0 והוא מתיר שימוש מסחרי מלא. הדרישה העיקרית היא מתן קרדיט ראוי למחברים שפרסמו את הבנצ'מרק.

מאיפה הגיעו הנתונים שבתוך המאגר?

היוצרים אספו ועיבדו שבעה מאגרים קיימים של חוקרים אחרים. המקורות כוללים פסיקות של בתי משפט, חקיקה רשמית של האיחוד האירופי, דיווחי חברות ציבוריות בארצות הברית, והסכמי תנאי שימוש של שירותים מקוונים.

איך טוענים

המאגר מחולק לקבצי Parquet לפי שבע המשימות ולפי חלוקות האימון, הבחינה והוולידציה הרגילות. הוא פתוח לחלוטין להורדה ישירה דרך Hugging Face בלי צורך בהרשמה מוקדמת או בקשת גישה. כדאי לשים לב שבגלל המבנה המודולרי, טוענים כל תת משימה בנפרד, ושמות השדות משתנים ביניהן: חלקן משתמשות בטקסט ובמספר תווית בודד, אחרות ברשימת תוויות, ובמשימת השאלות יש שדות להקשר ולמערך אפשרויות הסיום.

from datasets import load_dataset

ds = load_dataset("coastalcph/lex_glue")

הרישיון

הרישיון הוא CC BY 4.0. אפשר להשתמש בנתונים למטרות מחקר וגם לפיתוח מוצרים מסחריים, כולל אימון מודלים והפצה שלהם, כל עוד אתם נותנים קרדיט מתאים ליוצרים ומציינים אם ערכתם שינויים. אין דרישה לשתף את התוצרים באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗