GPT
C

cold-cases

קוד פתוח

harvard-lilcc0-1.02023-09-12

  • united states
  • law
  • legal
  • court
  • opinions

המאגר מרכז 8.3 מיליון פסקי דין והחלטות משפטיות מבתי משפט בארצות הברית יחד עם מטא-דאטה מקיף. זהו מקור עצום למי שמאמן מודלים על שפה משפטית באנגלית, בלי להסתבך עם סריקת מאגרים ממשלתיים.

  • 2,589הורדות בחודש
  • 42לייקים

מה זה

הנתונים מבוססים על המאגר הפתוח של CourtListener, שעבר עיבוד מחדש על ידי ספריית המשפטים של הרווארד בשיתוף Free Law Project. במקום טבלאות מפוצלות, כל החלטה שיפוטית ארוזה כרשומה אחת שכוללת את חוות הדעת העיקרית, דעות מיעוט, שמות השופטים ועורכי הדין, סיכומים, מילות מפתח והיסטוריה דיונית. טקסטים מיותרים הוסרו, והחומר כולל גם מידע על האופן שבו הופק הטקסט, למשל אם הוא עבר OCR או נולד דיגיטלית.

הרשומות מייצגות מנעד רחב מאוד של ערכאות שיפוטיות בארצות הברית, החל מבתי משפט פדרליים ומדינתיים, דרך בתי דין צבאיים ובתי משפט של שבטים מקומיים, ועד לערכאות מיוחדות. הסינון היחיד שבוצע על ידי הצוות של הרווארד נועד להגנת הפרטיות, וכלל הסרה של תיקים שנחסמו או הוסרו מאינדוקס על פי הכללים של CourtListener.

מתאים ל

  • אימון מודלי שפה למשפט

    אימון בסיס או התאמה של מודלי שפה על טקסטים משפטיים באנגלית בהיקף של מיליוני פסקי דין.

  • ניתוח תקדימים וציטוטים

    חקר רשתות הציטוטים בין ערכאות שונות בארצות הברית באמצעות שדות ההפניות והמטא-דאטה.

  • סיווג אוטומטי של עתירות

    בניית מודלים שמסווגים תיקים לפי סוג התביעה, הערכאה, או התוצאה הסופית של ההליך.

איפה זה נופל

הנתונים כולם באנגלית ומוגבלים למערכת המשפט האמריקאית, כך שאין כאן שום רלוונטיות לחוק או לפסיקה ישראלית. התיקים המשפטיים משקפים את המצב המשפטי שהיה נכון לשעתם, ולא מייצגים בהכרח את הדין העדכני. מעבר לזה, חלק מהטקסטים נוצרו מסריקות OCR ועלולים להכיל שגיאות פענוח. המפרסמים מדגישים שפסקי דין כוללים טענות עובדתיות לא נכונות או שנויות במחלוקת על אנשים אמיתיים, ולכן אסור להשתמש במידע הזה כמאגר עובדתי על פרטים כמו בדיקות רקע או רישום פלילי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן. הרישיון הוא נחלת הכלל, מה שמאפשר שימוש מסחרי מלא, שינוי הנתונים ואימון מודלים ללא צורך במתן קרדיט או בחשיפת קוד המקור שלכם.

האם המאגר כולל החלטות בעברית או מבתי משפט בישראל?

לא. כל הנתונים באנגלית ומגיעים אך ורק ממערכות המשפט של ארצות הברית, כולל ערכאות פדרליות, מדינתיות וטריטוריאליות.

איך החומר הזה נאסף והאם הוא שלם?

הטקסטים נאספו על ידי CourtListener ממקורות ממשלתיים פתוחים, ואנשי הרווארד איחדו וניקו אותם לרשומות אחידות. מתוך שיקולי פרטיות, הוסרו מהמאגר מקרים ספציפיים שנחסמו או נמחקו מהאינדקס של CourtListener.

איך טוענים

המאגר מאורגן בפורמט Apache Parquet ומחולק לעשרות קבצים דחוסים בנפח כולל של מעל מיליון רשומות, ללא צורך בהרשאה מיוחדת או בבקשת גישה. אפשר לעבוד איתו ישירות דרך ספריית Datasets של Hugging Face תוך שימוש ביכולות הזרמה (streaming), כך שלא חייבים להוריד את כל החומר למחשב המקומי. השדות המרכזיים לעיבוד טקסט הם opinions שכולל את מערך חוות הדעת השונות ואת הטקסט המלא שלהן, לצד שדות סיווג כמו court_jurisdiction ו־precedential_status.

from datasets import load_dataset

ds = load_dataset("harvard-lil/cold-cases")

הרישיון

המאגר שוחרר ברישיון cc0-1.0, כלומר נחלת הכלל. מותר להשתמש בו לכל מטרה, כולל שימוש מסחרי מלא, מחקר ואימון מודלים, בלי חובת ייחוס ליוצרים ובלי דרישה לשתף את התוצרים או המודלים המאומנים באותו רישיון.

הרישיון המלא ב־Hugging Face ↗