GPT
L

legal-bert-base-uncased

קוד פתוח

nlpauebcc-by-sa-4.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

אימון ייעודי מאפס על חוזים, חקיקה ופסיקה באנגלית הופך אותו לבסיס חזק לעיבוד טקסטים משפטיים. הוא מחליף את המילון הכללי של ברט במונחים ששייכים ישירות לתחום.

  • 512טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 223,103הורדות בחודש
  • 319לייקים

מה זה

החוקרים אימנו מודל ברט בגודל 110 מיליון פרמטרים ישירות על 12 גיגה בייט של טקסטים משפטיים באנגלית, ולא רק כיוונו מודל קיים. הקורפוס כלל כמעט 165 אלף תיקים מבתי משפט בארצות הברית, 116 אלף מסמכי חקיקה אירופית, עשרות אלפי חוזים ממאגר אדגר של הרשות לניירות ערך בארצות הברית, ופסיקה מבית הדין האירופי לזכויות אדם.

ההבדל מול ברט רגיל מתחיל במילון עצמו. במקום לחתוך מונחים משפטיים לחלקי מילים גנריים, הטוקנייזר נבנה ישירות מתוך הטקסטים האלה. בבדיקות השלמת מילים במסמכי זכויות אדם, המודל חזה את המילה עינויים בהסתברות מלאה של 1.00, לעומת 0.32 בלבד במודל הכללי.

מתאים ל

  • סיווג סעיפים בחוזים

    זיהוי סוגי תניות והתחייבויות בחוזים עסקיים באנגלית תודות לאימון על עשרות אלפי חוזים אמריקאיים.

  • השלמת מונחים משפטיים

    חיזוי והשלמת טקסט חסר במסמכים ופסיקה מתוך היכרות מעמיקה עם המינוח של בתי משפט.

  • חילוץ ישויות רגולטוריות

    בסיס לאימון מודל שמזהה גופים וחוקים מתוך מסמכי תקינה של האיחוד האירופי ובריטניה.

איפה זה נופל

הוא אומן אך ורק על אנגלית ומתאים לעולם המשפט המערבי, בעיקר ארצות הברית, בריטניה והאיחוד האירופי. אם תנסו להריץ אותו על מסמכים בעברית או על הדין הישראלי, תקבלו ג'יבריש וייצוגים חסרי ערך לחלוטין.

מגבלת האורך קשיחה ועומדת על 512 טוקנים, מה שאומר שאי אפשר לזרוק אליו חוזה שלם. צריך לחתוך מסמכים לפסקאות או להשתמש בו כשכבת חילוץ מאפיינים למודל אחר. בנוסף, הוא פועל רק באותיות קטנות.

שאלות
נפוצות

האם המודל מסוגל לעבד חוזים בעברית?

לא. המודל אומן כולו על טקסטים באנגלית והטוקנייזר שלו מכיר רק את השפה הזו. טעינת טקסט בעברית תוביל לפלט שגוי לחלוטין.

איך מכניסים לתוכו פסק דין ארוך של עשרות עמודים?

החלון מוגבל ל־512 טוקנים בלבד. אי אפשר להעביר מסמך ארוך בבת אחת, ויש לפרק את הטקסט למקטעים קצרים ולעבד כל קטע בנפרד.

למה לא להשתמש בברט הרגיל של גוגל?

ברט הכללי לא מכיר שפה משפטית באותה רמה ולעיתים קרובות מפרש מונחים מקצועיים בצורה שגויה. הגרסה הזו נבנתה במיוחד כדי לתת משקל נכון למינוח משפטי.

איך מריצים

טוענים אותו ישירות דרך ספריית הטרנספורמרס של האגינג פייס בפייתון. 110 מיליון פרמטרים ומשקל קבצים של 1.3 גיגה בייט אומרים שאפשר להריץ אותו בקלות על מעבד רגיל של שרת זול, אם כי לפיין טיונינג עדיף מעבד גרפי בסיסי עם 8 גיגה בייט זיכרון.

אם רוצים לחסוך משאבים, אותם חוקרים הוציאו גרסה קטנה שתופסת שליש מהגודל ורצה מהר פי ארבעה. אין צורך בשרתים כבדים או בשירותי ענן יקרים, זה מודל קל שמתאים לגמרי להרצה מקומית בתוך התשתית שלכם.

from transformers import pipeline

pipe = pipeline("fill-mask", model="nlpaueb/legal-bert-base-uncased")
print(pipe("שלום"))

הרישיון

הרישיון הוא קריאייטיב קומונס ייחוס ושיתוף זהה 4.0. אפשר להשתמש בו במוצרים מסחריים, אבל חובת הייחוס חלה עליכם, וכל נגזרת של המודל שתפיצו חייבת להשתחרר תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא בעמוד המודל ↗