GPT
P

pile-of-law

קוד פתוח

pile-of-lawcc-by-nc-sa-4.02022-03-02

מאגר ענק של טקסטים משפטיים ומינהליים באנגלית, בעיקר מארצות הברית. הוא מרכז פסיקות, חוקים, חוזים ופרוטוקולים למי שרוצה לאמן או לבחון מודלים לתחום המשפטי.

  • 7,733הורדות בחודש
  • 284לייקים

מה זה

המאגר כולל בין 10 ל־100 מיליון רשומות שמקורן בגופים ממשלתיים, בתי משפט, מאגרי חוזים ודיונים ציבוריים. תמצאו כאן פסיקות של בתי משפט פדרליים ומדינתיים דרך CourtListener, תקנות פדרליות, הצעות חוק, דיונים בקונגרס, חוזים ממאגר EDGAR ומפרויקט Atticus, וגם שאלות ותשובות מקהילות כמו r/legaladvice ברדיט. לצד החומר האמריקאי יש ייצוג קטן יותר למוסדות אירופיים, לקנדה ולבתי דין בינלאומיים.

המבנה הפנימי מחולק לתתי-קבצים לפי מקורות המידע, ללא נרמול אחיד של הטקסטים. כל רשומה כוללת את גוף הטקסט, חותמת זמן של יצירת המסמך, מועד איסוף המידע ברשת וכתובת ה־URL שממנה הוא נלקח. היוצרים מציינים שחותמות הזמן עלולות להיות לא מדויקות, למשל תאריך העלאת הקובץ למאגר חיצוני במקום תאריך פרסום הפסק המקורי.

מתאים ל

  • אימון מקדים למודלים משפטיים

    לימוד שפה מבוסס טקסטים רשמיים, כתבי טענות, חוזים ופסיקה אמריקאית.

  • מחקר על פרטיות והשחרת מידע

    ניתוח האופן שבו רשויות שונות מיישמות נורמות סינון על מידע רגיש.

  • הערכת מודלים במשימות מילוי

    בדיקת ביצועים של מודלים בהשלמת טקסט משפטי באנגלית (fill-mask).

איפה זה נופל

ההטיה המרכזית היא גיאוגרפית ושפתית: החומר כמעט כולו באנגלית ורובו המוחלט משקף את מערכת המשפט והממשל בארצות הברית. אין כאן נתונים בעברית או התאמה לדין הישראלי. הטקסטים כוללים הטיות מובנות של מערכות משפט, רשויות אכיפה ומוסדות שלטון. בנוסף, המסמכים עשויים לכלול מידע אישי ורגיש שלא נוקה במלואו מעבר לסינון המקורי של הרשויות, ולכן היוצרים אוסרים במפורש לאפשר למנועי חיפוש לאנדקס את המידע. המאגר אינו מתעדכן באופן שוטף, ואינו מתאים לשמש מקור מוסמך לפסיקה עדכנית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון המוגדר הוא cc-by-nc-sa-4.0 ששולל שימוש מסחרי באופן ברור. מעבר לכך, חלק מהמקורות שהוזנו למאגר כוללים מגבלות שימוש של הגופים המקוריים.

האם יש במאגר טקסטים בעברית או על הדין הישראלי?

לא, המאגר מוגדר לשפה האנגלית בלבד. התוכן מתמקד כמעט לחלוטין בארצות הברית, עם מעט חומרים מאירופה, קנדה ובתי דין בינלאומיים.

האם המידע מתאים למתן תשובות משפטיות אמינות?

לא. היוצרים מצהירים בפירוש שהמידע נועד למחקר בלבד ואינו מהווה מקור מוסמך. פסיקות וחוקים משתנים עם הזמן, ויש לפנות למקורות הרשמיים המעודכנים.

איך מחולקים הקבצים להורדה?

המאגר מורכב מ־122 קבצים בפורמט jsonl.xz, כאשר כל קובץ מייצג מקור מידע נפרד. כל מקור מחולק מראש ל־75% אימון ו־25% ולידציה.

איך טוענים

הנתונים מגיעים בקובצי JSONL דחוסים בפורמט xz, ומחולקים ל־122 קבצים שונים. אין צורך באישור גישה ידני או בהרשמה מיוחדת, וההורדה פתוחה ישירות דרך Hugging Face. כל תת-מאגר מחולק מראש לחלק אימון של 75% וחלק ולידציה של 25%, אך היוצרים מציינים שלא סיננו מראש דליפות מידע למשימות ספציפיות. השדות הקיימים הם text, created_timestamp, downloaded_timestamp ו־url.

from datasets import load_dataset

ds = load_dataset("pile-of-law/pile-of-law")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-sa-4.0, שאוסר שימוש מסחרי ומחייב שיתוף תחת אותו רישיון בדיוק לצד מתן קרדיט. מודל שאומן על הדאטהסט הזה יוגבל בשימוש מסחרי ויושפע מתנאי הרישיון. בנוסף, מקורות מסוימים בתוכו כפופים להגבלות מחמירות יותר של בעלי המידע המקוריים, כולל איסור מפורש על אינדוקס במנועי חיפוש.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗