GPT
C

caselaw_access_project

קוד פתוח

common-pileרישיון לא דווח2024-09-10

המאגר מרכז כמעט שבעה מיליון החלטות שיפוטיות מארצות הברית על פני 365 שנה. הוא מיועד למי שבונה מודלים לתחום המשפטי וצריך נפח עצום של פסיקה אמריקאית היסטורית ומודרנית.

  • 2,718הורדות בחודש
  • 219לייקים

מה זה

הנתונים מורכבים משני מקורות מרכזיים. המקור הראשון הוא Caselaw Access Project שמכיל קרוב לארבעים מיליון עמודי פסיקה וחוות דעת של שופטים מבתי משפט פדרליים ומדינתיים בארצות הברית. המקור השני הוא Court Listener, שמוסיף מעל 900 אלף תיקים שנאספו מ־479 בתי משפט שונים. המקורות הללו מתבססים על ספריות משפטיות כמו ספריית המשפטים של הרווארד, ספריית הקונגרס ומאגר בית המשפט העליון האמריקאי.

לפי הכרטיס, היוצרים אספו אך ורק מסמכים שנמצאים בנחלת הכלל, ה־public domain. הטקסטים עברו תהליכי דיגיטציה, תיקוני שגיאות סריקה ו־OCR, ועיבוד נוסף שנועד לסדר בעיות עימוד ופיענוח. המאגר מכיל 6,919,240 מסמכים סך הכל, וזוהי הגרסה הגולמית שלו לפני הסינון שנעשה עבור פרויקטים ספציפיים.

מתאים ל

  • אימון מודלי שפה למשפט

    אימון מקדים או המשך אימון של מודלים שצריכים להכיר ניסוחים משפטיים וטרמינולוגיה של בתי משפט בארצות הברית.

  • מחקר היסטורי של הפסיקה

    ניתוח התפתחות של מושגים משפטיים ופסיקות לאורך מאות שנים של היסטוריה משפטית אמריקאית.

  • משימות השלמת טקסט משפטי

    בניית כלי עזר לכתיבה וחיזוי טקסט עבור חוות דעת ופסקי דין באנגלית.

איפה זה נופל

החומר כולו באנגלית בלבד ועוסק אך ורק במערכת המשפט האמריקאית, כך שאין כאן שום רלוונטיות ישירה לדין הישראלי או למסמכים בעברית. הטקסטים נפרסים על פני 365 שנה, מה שאומר שיש פערים שפתיים ותרבותיים אדירים בין פסקי דין מוקדמים לפסיקה עכשווית. היוצרים מודים בפירוש שקיימת סכנה של זיהוי שגוי של רישיונות או מידע מטא-דאטה לא מדויק במסמכים מסוימים, ולכן יש היתכנות לזליגה של חומרים שאינם באמת בנחלת הכלל. בנוסף, זו הגרסה הגולמית ולא הגרסה המסוננת.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

היוצרים כיוונו למסמכים בנחלת הכלל, אך הרישיון בעמוד לא דווח רשמית. הם אף מזהירים במפורש מפני טעויות בזיהוי מעמד זכויות היוצרים של חלק מהמסמכים. לכן שימוש מסחרי דורש זהירות ובדיקה עצמאית.

כמה מקום המאגר תופס בדיסק?

המאגר תופס 78 גיגה-בייט בטקסט UTF-8 ומכיל כמעט שבעה מיליון מסמכים. הוא שמור ב־175 קובצי jsonl.gz.

האם יש במאגר נתונים בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד ומכיל פסיקה מבתי משפט בארצות הברית.

מה ההבדל בין המאגר הזה לגרסה המסוננת שלו?

המאגר הזה הוא הגרסה הגולמית שמכילה את כל החומר שנאסף מ־Caselaw Access Project ומ־Court Listener. קיימת גרסה מסוננת נפרדת שנוצרה על ידי אותו צוות לצורך אימון מודל Comma v0.1.

איך טוענים

הדאטהסט שוקל 78 גיגה-בייט בקידוד UTF-8 ומחולק ל־175 קבצים בפורמט jsonl דחוסים בסיומת gz. אין צורך לבקש אישור גישה מיוחד כדי להוריד אותו מהאגר. צריך לקחת בחשבון את נפח האחסון והזיכרון בעבודה עם קבצים דחוסים בגודל כזה, וקוד האיסוף והעיבוד המלא זמין במאגר הגיטהאב של common-pile למי שרוצה לשחזר את הצעדים.

from datasets import load_dataset

ds = load_dataset("common-pile/caselaw_access_project")

הרישיון

הרישיון הרשמי בעמוד מוגדר כלא דווח. היוצרים מציינים שהם כללו רק מסמכים שלמיטב בדיקתם נמצאים בנחלת הכלל, אך מזהירים מפני טעויות בזיהוי הרישיונות ובמטא-דאטה. עבור חברות ומפתחים שמתכננים לאמן מודל מסחרי, היעדר רישיון מוגדר וברור בעמוד והאזהרה של היוצרים עצמם מחייבים בדיקה משפטית זהירה לפני השימוש.

הרישיון המלא ב־Hugging Face ↗