GPT
I

InLegalBERT

קוד פתוח

law-aimit2022-09-11

  • transformers
  • pytorch
  • bert
  • pretraining
  • legal

זהו מודל שפה שמיועד ספציפית לניתוח טקסטים משפטיים מהודו באנגלית. מי שמפתח כלי לחיפוש, סיווג או חילוץ מידע מפסקי דין הודיים יקבל כאן ייצוג מדויק בהרבה ממודל כללי.

  • 512טוקנים בהקשר
  • 510 MBמשקל הקבצים
  • 66,631הורדות בחודש
  • 112לייקים

מה זה

הבסיס כאן הוא מודל LegalBERT מוכר שעבר אימון נוסף על 5.4 מיליון מסמכים משפטיים מבתי המשפט בהודו, בהיקף של כ־27 גיגה בייט טקסט. המפתחים אימנו אותו במשך 300 אלף צעדים על משימות חיזוי מילים מוסתרות וחיזוי המשפט הבא, בדיוק לפי המבנה של מודל בסיס רגיל.

במקום להתמודד עם אנגלית כללית, הוא מכיר את הטרמינולוגיה של מערכת המשפט ההודית מ־1950 עד 2019. המפרסמים בדקו אותו מול חלופות על שלוש משימות: זיהוי סעיפי חוק רלוונטיים, חלוקת פסק דין למקטעים לוגיים וחיזוי קבלה או דחייה של עתירות. לפי התוצאות שלהם, ההתמחות המקומית מנצחת את המודלים הכלליים בכל אחת מהבדיקות.

מתאים ל

  • סיווג מקטעים בפסק דין

    זיהוי עובדות, טיעונים והחלטות בתוך פסקי דין באנגלית מהודו באמצעות תיוג משפטים.

  • שיוך סעיפי חוק

    התאמת סעיפי חוק רלוונטיים מתוך תיאור עובדתי של מקרה משפטי מורכב.

  • חיפוש סמנטי משפטי

    הפקת וקטורים מטקסט משפטי באנגלית כדי למצוא תקדימים דומים במאגר.

איפה זה נופל

חלון ההקשר עומד על 512 טוקנים בלבד. בטקסטים משפטיים של עשרות עמודים, מדובר במגבלה קשה שתחייב אתכם לחתוך את המסמך למקטעים קטנים ולנהל את החיבור ביניהם לבד. בנוסף, הוא אומן רק על אנגלית ממערכת המשפט של הודו. הוא לא מתאים לעברית, הוא לא מכיר את הדין הישראלי, ואין לו יכולת לייצר טקסט חופשי אלא רק למלא מילים חסרות או להפיק ייצוגים מתמטיים לצורך אימון מודלים ייעודיים.

שאלות
נפוצות

האם המודל יכול לעזור בניתוח פסקי דין בישראל?

לא. המודל אומן אך ורק על אנגלית ועל החוק ההודי. מעבר למחסום השפה, המושגים והמבנה המשפטי שונים לחלוטין ממה שנהוג בארץ.

האם אפשר להשתמש בו כמו צ'אטבוט לכתיבת חוזים?

לא. מדובר במודל שמייצר ייצוגים ומזהה מילים מוסתרות, לא במודל שיוצר טקסט חדש או עונה על שאלות בשפה חופשית.

איך מריצים

בגודל של כ־110 מיליון פרמטרים וקבצים של חצי גיגה בלבד, אפשר להריץ אותו כמעט בכל מקום. מעבד רגיל במחשב פיתוח יספיק לבדיקות מקומיות, וכרטיס מסך פשוט יריץ מנות גדולות בלי להרגיש עומס.

המודל מגיע מהספרייה הפופולרית ומחזיר וקטורים לייצוג הטקסט. אם כל מה שאתם צריכים זה לסווג פסקאות או לבנות חיפוש סמנטי פנימי, אין שום סיבה לשלם לספקי ענן על קריאות חיצוניות, פשוט מעלים אותו לשרת פרטי ומקבלים שליטה מלאה על המידע הרגיש.

from transformers import pipeline

pipe = pipeline("fill-mask", model="law-ai/InLegalBERT")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 510 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון MIT פתוח ומתיר כמעט הכל. מותר להשתמש במודל למוצרים מסחריים, לשנות אותו, להטמיע אותו בשרתים פרטיים או להפיץ אותו הלאה, כל עוד שומרים על הודעת זכויות היוצרים המקורית בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗