GPT
M

Multi_Legal_Pile

קוד פתוח

joelniklauscc-by-nc-sa-4.02022-09-26

המאגר מרכז 689GB של טקסטים משפטיים ב־24 שפות לאימון מודלי שפה. הוא מיועד למי שבונה מודל ייעודי לעולם המשפט וצריך פסיקה, חקיקה וחוזים בכמויות גדולות.

  • 4,522הורדות בחודש
  • 67לייקים

מה זה

המאגר כולל עשרות מיליוני מסמכים בחלוקה לחמישה סוגי תוכן: פסיקה, חקיקה, חוזים, תת-מאגר בשם legal_mc4, ותכנים משפטיים כלליים נוספים. הרשומות מגיעות מארבעה מקורות עיקריים שחוברו יחד: קורפוס מקורי שנאסף עבור המאגר בהיקף 112GB, משאבי Eurlex בהיקף 179GB, תת-מאגר MC4 משפטי בנפח 106GB, וחלקים נבחרים מתוך Pile of Law בהיקף 292GB.

המקורות הראשוניים מגוונים מאוד וכוללים מאגרי פסיקה רשמיים, אתרי בתי משפט עליונים, ומאגרי חקיקה ממשלתיים. בין היתר נאספו החלטות מבתי המשפט בצ'כיה, פסיקה וחקיקה מדנמרק, נתונים מגרמניה, שווייץ, צרפת, בלגיה וברזיל, לצד מאגר MARCELL שסיפק חקיקה ממדינות כמו בולגריה, הונגריה, פולין, רומניה וסלובקיה. כרטיס המאגר לא מפרט את אופן הסינון והניקוי שנעשו.

מתאים ל

  • אימון מקדים למודל שפה

    אימון מודלי בסיס ייעודיים לתחום המשפטי באמצעות משימת fill-mask בשפות אירופיות מרכזיות.

  • הערכת ביצועים רב-לשונית

    בדיקת יכולות של מודלים קיימים בהבנת טרמינולוגיה משפטית, חקיקה ופסיקה במספר תחומי שיפוט.

  • מחקר משווה בניתוח טקסט

    השוואת מבנה כתיבה ודפוסי ניסוח בין מסמכי פסיקה, חוזים וחקיקה לאורך מספר מערכות משפט באירופה.

איפה זה נופל

הנפח הכולל מטעה מאוד מבחינת הפיזור הגיאוגרפי. אנגלית, פורטוגזית של ברזיל, גרמנית וצרפתית תופסות נתח ענקי מהטקסטים, בעוד שפות אחרות מיוצגות בעיקר בחקיקה קצרה דרך מאגר MARCELL. עברית אינה קיימת כלל במאגר. מעבר לכך, כרטיס הדאטהסט מותיר סעיפים קריטיים רבים ריקים לחלוטין, כולל מידע על הסרת פרטים מזהים, מגבלות ידועות והטיות. חלק ניכר מהמקורות לא מפרט תאריכי עדכון או רישיונות מקור, ולכן אי אפשר לדעת עד כמה החקיקה או הפסיקה מעודכנות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון המוצהר הוא cc-by-nc-sa-4.0 שכולל איסור מפורש על שימוש מסחרי. בנוסף חלה חובת שיתוף זהה, כך שכל תוצר נגזר חייב להישאר תחת אותו רישיון חופשי למחקר. אימון מודל לצורך מוצר עסקי מהווה הפרה של תנאי השימוש.

האם יש במאגר נתונים בעברית?

לא, המאגר אינו כולל עברית כלל. הוא מכסה 24 שפות, ברובן שפות רשמיות של האיחוד האירופי בתוספת אנגלית ופורטוגזית. מי שמחפש טקסטים משפטיים מקומיים או חקיקה ישראלית יצטרך לפנות למקורות אחרים.

כמה שטח אחסון נדרש כדי להוריד את המאגר?

המאגר המלא שוקל 689GB בקבצים מכווצים בפורמט jsonl.xz. בשל הגודל הזה, טעינה ישירה לזיכרון אינה מעשית ברוב המחשבים. מומלץ לעבוד עם טעינה בהזרמה או להוריד רק חתכים ספציפיים של שפה וסוג מסמך.

מה ההבדל בין מאגר זה ל־Pile of Law?

המאגר הנוכחי רב-לשוני וכולל 24 שפות, בעוד ש־Pile of Law מתמקד כמעט לחלוטין באנגלית ובמערכת המשפט האמריקאית. חלקים מתוך Pile of Law בהיקף של 292GB שולבו כאן כתת-קבוצה באנגלית, אך נוספו אליהם מאות גיגה-בייט של פסיקה וחקיקה מאירופה ומברזיל.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות פקודת load_dataset עם ציון שם המאגר והקונפיגורציה הרצויה. הקונפיגורציות בנויות משילוב של קוד שפה וסוג טקסט, למשל en_contracts או de_caselaw, וניתן לטעון חתכים מלאים כמו all_legislation. הקבצים שמורים בפורמט jsonl.xz, והמאגר מציע פיצול יחיד של train. בגלל נפח כולל של 689GB, מומלץ להשתמש בפרמטר streaming=True כדי להזרים שורות במקום להוריד את כל המידע לכונן. אין צורך באישור גישה מיוחד, אך כרטיס הדאטהסט לא מפרט את שמות השדות המדויקים בכל רשומה.

from datasets import load_dataset

ds = load_dataset("joelniklaus/Multi_Legal_Pile")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-sa-4.0. הרישיון אוסר שימוש מסחרי מכל סוג, דורש מתן קרדיט ליוצרים, ומחייב שכל יצירה נגזרת תופץ תחת אותו רישיון בדיוק. מודל שאומן על הנתונים הללו יהיה מוגבל למחקר בלבד ולא יוכל לשמש בסיס למוצר מסחרי. בנוסף, חלק מהמקורות הפנימיים נושאים רישיונות שונים או מוגדרים ללא מידע על רישוי, ותת-המאגר legal_mc4 הופרד במיוחד בגלל מגבלות רישוי נוספות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗