GPT
C

case-law

קוד פתוח

HFforLegalcc-by-4.02024-07-21

  • legal
  • droit
  • fiscalité
  • taxation
  • δεξιά

מאגר פסקי דין והחלטות משפטיות ממדינות שונות במבנה אחיד. הוא מתאים למי שרוצה לאמן מודלים על טקסטים משפטיים מלאים באנגלית ובצרפתית בלי לאסוף אותם בעצמו.

  • 2,766הורדות בחודש
  • 32לייקים

מה זה

המאגר מאגד החלטות משפטיות מלאות בחלוקה לפי מדינות, כאשר כל חלוקה מזוהה לפי קוד מדינה של שתי אותיות. כל רשומה כוללת מזהה ייחודי, כותרת, ציטוט משפטי, מספר תיק, אזור שיפוט או מדינה ספציפית, שם הגורם המנפיק, חותמת זמן, גיבוב אבטחה של התוכן וטקסט המסמך המלא.

הכרטיס מציג שאיפה לרכז פסיקה ממדינות רבות בעולם, אך רשימת הקבצים בפועל מציגה בעיקר מקטעי חלוקה של ארצות הברית בפורמט ארו, לצד סימון לשפה הצרפתית. המפרסמים לא פירטו בכרטיס מאיזה מאגרים או בתי משפט נשאבו המסמכים במקור ואיזה סינון בוצע עליהם בפועל.

מתאים ל

  • אימון מודלי שפה משפטיים

    לימוד ייצוגי שפה ומונחים מתוך טקסטים של פסיקה מלאה באנגלית ובצרפתית.

  • מענה על שאלות משפטיות

    בניית מערכות המאתרות החלטות או פרטים לפי מספרי תיקים ומובאות.

  • מחקר משפטי השוואתי

    ניתוח הבדלי ניסוח ומבנה של פסקי דין באזורי שיפוט שונים.

איפה זה נופל

הכרטיס מציין רשימת שפות שכוללת רק אנגלית וצרפתית, כך שאין כאן שום חומר בעברית או התייחסות לדין ישראלי. חסר מידע קונקרטי על שיטות האיסוף, אנונימיזציה של פרטים אישיים, וטווח התאריכים של פסקי הדין. פסיקה משתנה עם הזמן, והיוצרים עצמם מזהירים שנדרשת בדיקה ידנית כדי לוודא שהמסמכים אכן מעודכנים ואינם מוטים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא מסוג ייחוס 4.0 שמתיר שימוש מסחרי מלא. הדרישה העיקרית היא מתן קרדיט ברור למחברים, לואי ברולה נודה וטימותי דולן.

האם יש במאגר נתונים מישראל או בעברית?

לא. המאגר מוגדר רשמית רק עבור אנגלית וצרפתית, והקבצים הקיימים מתמקדים בעיקר בארצות הברית. אין בו פסיקה ישראלית.

איך המידע נאסף וסונן?

הכרטיס לא מפרט את מקורות הגירוד, שמות בתי המשפט שמהם הגיעו התיקים או תהליכי ניקוי המידע. אם נדרש ביטחון מלא במקורות הטקסט ובאנונימיזציה, יש לבדוק את הנתונים עצמאית.

איך טוענים

טוענים את המאגר ישירות בעזרת הפונקציה הרגילה של ספריית הדאטהסטים של האגינג פייס. אין צורך לבקש אישור גישה מראש. אפשר לטעון את כל המאגר או לגשת לחלוקה של מדינה ספציפית לפי קוד המדינה שלה. הנתונים שמורים ב־24 קבצים, כולל קובצי ארו בחלקים עבור ארצות הברית, והשדה המרכזי לאימון מודלים הוא שדה הטקסט המלא לצד מטא-דאטה של תאריך ומספר תיק.

from datasets import load_dataset

ds = load_dataset("HFforLegal/case-law")

הרישיון

המאגר מופץ תחת רישיון קריאייטיב קומונס ייחוס 4.0. הרישיון מתיר שימוש מסחרי, שינוי ושילוב של הנתונים במודלים ובמערכות, כל עוד נותנים קרדיט מתאים ליוצרים ומציינים אם נעשו שינויים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗