GPT
L

legalbench

קוד פתוח

nguhacc-by-4.02023-03-16

  • legal
  • law
  • benchmark

אוסף משימות סיווג ומענה לשאלות שמיועד להערכת מודלים על טקסטים משפטיים. מתאים למי שרוצה לבדוק יכולות ניתוח חוזים, סיווג פסיקות והבנת מושגים באנגלית.

  • 17,178הורדות בחודש
  • 187לייקים

מה זה

המאגר מחולק לעשרות תתי-קונפיגורציות שונות, שכל אחת מהן מייצגת משימה משפטית מוגדרת. הרשומות עוסקות במגוון תחומים כמו סעיפי חוזים מתוך CUAD, שאלות מתוך ContractNLI, סוגיות צרכניות, תוצאות של בית משפט למיסים בקנדה ותחומי משפט אזרחי כמו נזיקין, משפחה ודיור מתוך Learned Hands.

הטקסטים כוללים פירוק לסעיפים ספציפיים, הגדרות משפטיות, ניתוח קשר סיבתי וסיווג לפי חוקים שונים. רוב הנתונים בנויים סביב בדיקה של תנאי חוזה, בלעדיות, תקופות אחריות או זיהוי עילות תביעה. הנתונים מאורגנים בקובצי TSV מפוצלים מראש לאימון ולבדיקה עבור כל תת-משימה בנפרד.

מתאים ל

  • בנצ'מרק למודלי שפה

    בדיקת יכולת המודל להבין מונחים משפטיים וסעיפי חוזים מורכבים.

  • סיווג סעיפי חוזים

    אימון מסווגים לזיהוי הגבלת אחריות, בלעדיות וסעיפי סודיות.

  • מענה לשאלות משפטיות

    פיתוח מערכות לשליפת תשובות מתוך חוזים ומסמכים רגולטוריים.

איפה זה נופל

כל הטקסטים במאגר הם באנגלית בלבד ומתבססים בעיקר על מערכות משפט אנגלו-סקסיות כמו ארה"ב וקנדה. אין בו מילה אחת בעברית או התייחסות לדין הישראלי, כך שהוא לא מתאים לאימון מודל שצריך לנתח חוזה ישראלי או להכיר חקיקה מקומית. בנוסף, מדובר במשימות ממוקדות מאוד שמפרקות חוזים לסעיפים קצרים, מה שלא בודק הבנה של מסמכים שלמים וארוכים.

שאלות
נפוצות

האם המאגר כולל נתונים בעברית?

לא. כל הנתונים במאגר כתובים באנגלית ומבוססים על המשפט האמריקאי והקנדי. הוא לא יסייע בפיתוח יישומים שדורשים הבנה של הדין הישראלי.

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. הרישיון המדווח הוא CC BY 4.0 שמתיר שימוש מסחרי מלא. הדרישה היחידה היא מתן קרדיט מתאים ליוצרי המאגר וציון שינויים אם נעשו.

איך הנתונים מאורגנים טכנית?

המאגר מורכב מ־332 קבצים המחולקים לעשרות קונפיגורציות. כל קונפיגורציה מייצגת משימה משפטית נפרדת ומכילה קובצי TSV נפרדים לאימון ולבדיקה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets על ידי ציון שם המאגר והקונפיגורציה הרצויה, למשל abercrombie או אחת מתתי-המשימות של CUAD. אין צורך בבקשת גישה מיוחדת או באימות מול המאגר, הגישה פתוחה לחלוטין. כל משימה מגיעה בקובצי TSV נפרדים עם פיצול מובנה לסט אימון ולסט בדיקה, כך שצריך לבחור מראש במשימה הרלוונטית ולא לטעון את כל 332 הקבצים יחד.

from datasets import load_dataset

ds = load_dataset("nguha/legalbench")

הרישיון

המאגר מופץ תחת רישיון CC BY 4.0. הרישיון מאפשר שימוש מסחרי, שינוי ושילוב במערכות אחרות, כל עוד נותנים קרדיט מתאים ליוצרים ומציינים אם בוצעו שינויים. אין חובה לשתף מודלים שאומנו עליו תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗