GPT
C

cuad-qa

קוד פתוח

theatticusprojectcc-by-4.02022-03-02

עשרות אלפי שאלות ותשובות שמאתרות 41 סוגי סעיפים משפטיים בתוך חוזים מסחריים אמיתיים. אם אתם בונים כלי לניתוח חוזים באנגלית, זה בסיס הנתונים המפוקח והמקצועי ביותר שתמצאו ברשת.

  • 1,616הורדות בחודש
  • 67לייקים

מה זה

המאגר מכיל דוגמאות בפורמט מענה על שאלות שמבוססות על 510 חוזים מסחריים באנגלית. כל החוזים נלקחו ממאגר הדיווחים של רשות ניירות הערך האמריקאית, וכוללים 25 סוגי הסכמים שונים כמו רישיונות, הפצה וייעוץ עסקי. על גבי הטקסטים האלה יצרו עורכי דין וסטודנטים למשפטים יותר מ־13,000 תיוגים ידניים עבור 41 קטגוריות של סעיפים קריטיים, ביניהם סעיפי בלעדיות, שיפוי ותנאי סיום התקשרות.

כל רשומה מייצגת שאלה ספציפית לגבי סעיף מסוים ומצביעה על מיקום התשובה המדויק בחוזה. המאגר מחולק ל־22,450 דוגמאות אימון ו־4,182 דוגמאות בדיקה. תהליך הסינון והבדיקה היה קפדני מאוד וכלל הכשרה ארוכה של המתייגים, חיפוש מילות מפתח, ביקורת עמיתים ואישור סופי של עורכי דין מנוסים בעזרת מערכות AI ייעודיות.

מתאים ל

  • חילוץ סעיפים מחוזים

    אימון מודלים שמאתרים ומסמנים סעיפי סיכון כמו אי-תחרות או תנאי ביטול בתוך מסמכים עסקיים ארוכים.

  • הערכת מודלי שפה משפטיים

    בדיקת יכולת של מודלי QA להתמודד עם הבנת הנקרא מורכבת וזיהוי מדויק של קטעי טקסט צרים בטקסט משפטי כבד.

  • סיווג מסמכים אוטומטי

    בניית מערכות מיון לחוזים תאגידיים המזהות קיומן של התחייבויות ספציפיות לפי הגדרות משפטיות אחידות.

איפה זה נופל

כל החוזים נכתבו באנגלית אמריקאית תאגידית, כך שהם לא רלוונטיים לחוזים בעברית או לדין הישראלי בלי התאמות משמעותיות. בנוסף, הקבצים הומרו מ־PDF למסמכי טקסט פשוטים, מה שגרם לבעיות ריווח, שבירת שורות ואובדן מוחלט של מבנה טבלאות. ישנם גם סעיפים מושחרים שסומנו בכוכביות, וקטעי טקסט לא רציפים שחוברו יחד עם הסימון omitted. היוצרים עצמם מבהירים שהסעיפים והחוזים אינם מייצגים או מקיפים את כל עולם החוזים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון המאגר הוא cc-by-4.0 ומאפשר שימוש מסחרי חופשי, כולל אימון מודלים ומכירת השירותים שלהם. החובה היחידה היא לתת קרדיט ברור לפרויקט. יחד עם זאת, היוצרים מציינים שאין להם אחריות על זכויות היוצרים של החוזים המקוריים, שנלקחו ממאגר המסמכים הפומבי של ה־SEC.

האם הדאטהסט כולל חוזים בעברית?

לא, המאגר כולו באנגלית בלבד. החוזים מנוסחים בסגנון משפטי אמריקאי תאגידי. לא הייתי משתמש בו ישירות לאימון מודלים שנועדו לקרוא חוזים ישראליים או טקסטים בעברית.

איך נאספו החוזים ותויגו התשובות?

הטקסטים נאספו ממאגר EDGAR של רשות ניירות הערך האמריקאית. תהליך התיוג ארך כשנה וכלל עשרות סטודנטים למשפטים שעברו הכשרה מעמיקה, תייגו 41 קטגוריות סעיפים, ועברו בקרה כפולה של עורכי דין בכירים וכלי תיוג מבוססי AI.

האם אפשר להשתמש בטקסטים כמו שהם לעיבוד שפה?

צריך לנקות אותם קודם. החוזים עברו המרה מ־PDF ולכן תמצאו בהם רווחים לא עקביים, טקסטים מושחרים שסומנו בכוכביות, וטבלאות שהמבנה שלהן נהרס. בנוסף, תשובות מקוטעות מכילות את המחרוזת omitted שצריך לטפל בה בקוד.

איך טוענים

טוענים את המאגר ישירות בעזרת פקודת load_dataset רגילה של Hugging Face דרך סקריפט הפייתון cuad-qa.py. אין צורך באישור גישה מיוחד או בהרשמה מראש. השדות החשובים בכל רשומה הם context שמכיל את הטקסט החוזי, question שמגדירה איזה סוג סעיף יש לאתר, ומילון answers שמחזיר את המחרוזת המדויקת יחד עם answer_start, המיקום המספרי של תחילת הקטע בטקסט.

from datasets import load_dataset

ds = load_dataset("theatticusproject/cuad-qa")

הרישיון

התיוגים והמאגר מופצים ברישיון cc-by-4.0 המאפשר שימוש מסחרי, שינוי והפצה, בתנאי שאתם נותנים קרדיט מלא ליוצרים. מותר לאמן מודלים למוצרים מסחריים. עם זאת, היוצרים מציינים במפורש שהם לא אחראים לסטטוס זכויות היוצרים של החוזים המקוריים עצמם, אף שהם הורדו באופן ציבורי ממאגר הרגולציה האמריקאי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗