GPT
C

ChatLaw-Text2Vec

קוד פתוח

chestnutlzjapache-2.02023-06-17

  • transformers
  • pytorch
  • bert
  • feature-extraction
  • sentence-similarity

הטמעה ייעודית למסמכים משפטיים בסינית, שאומנה על קרוב למיליון זוגות מקרים. הוא רלוונטי למי שבונה חיפוש וקטורי ממוקד לתחום המשפט בסין.

  • 512טוקנים בהקשר
  • 391 MBמשקל הקבצים
  • 136הורדות בחודש
  • 108לייקים

מה זה

מדובר במודל מבוסס BertModel בן 12 שכבות שממיר טקסטים לוקטורים לצורך חישוב דמיון סמנטי. הייחוד שלו הוא דאטהסט האימון, שכולל 936,727 זוגות של מקרים ממאגר התקדימים והפסיקה של בתי המשפט בסין, לצד חוקים ותקנות רשמיות.

במקום להסתמך על מודל שפה כללי שלעיתים מפספס את הדקויות והז'רגון של עולם המשפט, הוא יודע לחבר בין ניסוח חופשי של שאלה לבין סעיפי החוק היבשים. לדוגמה, בדוגמת השימוש הוא מחזיר ציון דמיון גבוה מאוד של 0.9960 בין שאלה על אי החזרת חוב לבין הסעיף המתאים מחוק החוזים.

מתאים ל

  • חיפוש תקדימים משפטיים

    הוא אומן ישירות על מאגר של כמיליון מקרים אמיתיים ומחבר היטב בין תיאור מקרה לפסיקה דומה.

  • בסיס ידע למענה משפטי

    מתאים לאחזור סעיפי חוק רלוונטיים עבור שאילתות משתמשים בסינית לצורך בניית מאגר וקטורי.

  • השוואת חוזים בסינית

    הארכיטקטורה שלו מותאמת לזהות התאמה סמנטית בין ניסוחי סעיפים שונים שמשמעותם המשפטית זהה.

איפה זה נופל

הוא יודע לעבוד בסינית בלבד ולא מיועד לשפות אחרות. מעבר לזה, חלון ההקשר מוגבל ל־512 טוקנים, כך שאי אפשר להזין לתוכו פסקי דין ארוכים בלי לחתוך אותם לחתיכות קטנות מראש.

הכרטיס מציג דוגמאות בודדות ואינו מפרט ציוני בנצ'מרק השוואתיים או מדדי דיוק רשמיים מול מודלים מתחרים. אם המערכת שלכם עוסקת בתחום מחוץ לדין הסיני, המודל הזה פשוט לא יתאים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית או באנגלית?

לא. המודל הוגדר ואומן עבור השפה הסינית בלבד. ניסיון להזין שפות אחרות יניב ייצוגים וקטוריים לא מדויקים שלא ישקפו דמיון סמנטי.

האם הוא מסוגל לקרוא מסמך משפטי מלא בבת אחת?

לא. המגבלה הקשיחה שלו היא 512 טוקנים. אם יש לכם מסמכים ארוכים, תצטרכו לפצל אותם לפסקאות קצרות לפני שמייצרים מהם וקטורים.

איך מריצים

במשקל כולל של 391 מגה-בייט ודיוק float32, אין שום סיבה לשלם על API חיצוני. אתם טוענים אותו ישירות דרך ספריית sentence_transformers או transformers ומריצים אותו בלי בעיה על מעבד רגיל, אפילו בתוך קונטיינר קטן, בלי חובה להחזיק כרטיס מסך ייעודי.

אם יש לכם כרטיס מסך בסיסי, הוא יעבד כמויות גדולות של פסקאות בשניות. קריאה ל־API חיצוני מתאימה רק אם התשתית שלכם לחלוטין חסרת שרתים ואין לכם רצון לתחזק מודלים מקומית, אבל בגודל הזה כמעט תמיד עדיף להריץ בעצמכם.

from transformers import pipeline

pipe = pipeline("sentence-similarity", model="chestnutlzj/ChatLaw-Text2Vec")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗