GPT
D

DISC-Law-SFT

קוד פתוח

ShengbinYueapache-2.02023-09-23

  • legal

מאגר אימון מבוסס הנחיות לתחום המשפטי בסינית, עם מאות אלפי דוגמאות לחילוץ מידע, חיזוי פסקי דין ומענה לשאלות. הוא מכוון למי שבונה מודלים לתחום המשפט הסיני או לחקר יכולות הסקה.

  • 784הורדות בחודש
  • 179לייקים

מה זה

המאגר מורכב ממספר חלוקות עיקריות שנועדו לכסות משימות משפטיות שונות. החלק המרכזי נקרא Pair, והוא מכיל עשרות אלפי דוגמאות של משימות כמו חילוץ מידע משפטי, זיהוי אירועים, סיווג תיקים, סיכום טקסטים משפטיים, מבחני לשכה ומענה לשאלות ייעוץ. המטרה של החלק הזה היא ללמד מודלים לבצע הסקה משפטית ישירה מתוך הקלט.

החלק השני נקרא Triplet, והוא מתמקד במשימות של חיזוי פסקי דין ומענה לשאלות תוך שילוב ידע משפטי חיצוני. בנוסף, המפתחים כללו נתונים ממקורות כלליים כמו Alpaca GPT4 ו־Firefly כדי למנוע הידרדרות של המודל במשימות שפה כלליות. לפי הדיווח שלהם הטבלה מציגה היקף כולל של 403 אלף דוגמאות, אך הם מציינים כי שחררו רק את רוב הדאטהסט ולא את כולו.

מתאים ל

  • אימון מודל משפטי בסינית

    אימון מודלים מותאמים אישית לחיזוי פסקי דין, סיווג תיקים ומענה לשאלות ייעוץ משפטי בסין.

  • חילוץ מידע מפסקי דין

    כוונון מודלים לשליפת ישויות ואירועים מתוך תיעוד משפטי מורכב בסינית.

  • מחקר על הסקה משפטית

    בדיקת היכולת של מודלי שפה לשלב ידע חיצוני ולפתור מבחני לשכה משפטיים.

איפה זה נופל

הנתונים כולם בסינית ומתבססים על מערכת המשפט והחוקים של סין בלבד. אין כאן שום רלוונטיות למערכת המשפט הישראלית או לטקסטים בעברית. בנוסף, חלק מהנתונים הכלליים מבוססים על דאטה שנוצר או סונן באמצעות מודלים כמו GPT-4, כך שקיימת תלות בהטיות של מודלים אלו. הכרטיס מודה שרק רוב המאגר שוחרר לציבור, ולכן חלק מהדוגמאות המקוריות אינן זמינות להורדה ישירה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי מלא ללא תשלום תמלוגים. אתם רק נדרשים לשמור על תנאי הייחוס של הרישיון ולציין את המקור. אין מניעה למכור מוצרים שמבוססים על מודלים שאומנו עליו.

האם יש במאגר נתונים בעברית או תמיכה בחוק הישראלי?

לא, המאגר מיועד באופן בלעדי למערכת המשפט בסין וכל הטקסטים שבו כתובים בסינית. הוא לא כולל שום מידע על חקיקה או פסיקה ישראלית. שימוש בו לפרויקט מקומי ידרוש תרגום והתאמה עמוקה שלא בטוח שיש בהן היגיון.

איך הדאטה נאסף ונבנה לפי המפתחים?

החוקרים אספו דוגמאות מעולמות תוכן משפטיים שונים כמו מבחני לשכה, שאלות ייעוץ ופסקי דין, וחילקו אותן לזוגות ושלישיות נתונים. בנוסף, הם צירפו מאגרים מוכרים כמו Firefly ו־Alpaca GPT4 כדי לשמור על יכולות שיחה כלליות. לפי הדיווח שלהם לא כל הנתונים שנאספו שוחררו בפועל להורדה, אלא רק רובם הגדול.

מה ההבדל בין קובצי Pair לקובצי Triplet במאגר?

קובצי ה־Pair נועדו ללמד את המודל לבצע הסקה משפטית ישירה מתוך פנייה או מסמך בודד. לעומת זאת, קובצי ה־Triplet מכילים מבנה של שלושה חלקים כדי לעזור למודל להשתמש במקורות ידע חיצוניים לצורך מענה וחיזוי. השילוב ביניהם מאפשר אימון גם ליכולת ניתוח עצמאית וגם לעבודה מול מאגרי ידע.

איך טוענים

הקבצים שמורים בפורמט jsonl, ביניהם קובצי זוגות ושלישיות למשימות השונות. הגישה פתוחה ואין צורך באישור מיוחד כדי להוריד את הנתונים. המבנה מבוסס על שדות קלט ופלט המותאמים למשימות של supervised fine-tuning, כאשר בחלק מהקבצים יש שדות ייעודיים לשאלות ותשובות או להקשר נוסף. בגלל שהטקסט בסינית, מומלץ לוודא שהטוקנייזר שלכם תומך בשפה בצורה יעילה לפני שמתחילים באימון.

from datasets import load_dataset

ds = load_dataset("ShengbinYue/DISC-Law-SFT")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, מחקרי, שינוי והפצה של הנתונים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף את המודל המאומן או את הפיתוחים שלכם תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗