GPT
V

vietnamese-legal-documents

קוד פתוח

th1nhng0cc-by-4.02026-03-31

  • legal
  • vietnamese
  • law
  • government

מאגר מסמכים משפטיים מווייטנאם עם מטא דאטה עשיר וגרף קשרים בין חוקים. הוא מיועד למי שבונה מודלים לתחום המשפטי בווייטנאמית וצריך טקסט מקור מלא לצד הפניות הדדיות.

  • 1,205הורדות בחודש
  • 44לייקים

מה זה

המאגר מכיל חוקים, צווים, חוזרים והחלטות ממשלתיות שנאספו ישירות מהפורטל הממשלתי של משרד המשפטים הווייטנאמי באמצעות סקרייפר ייעודי. הנתונים מחולקים לחמש תצורות שונות לפי צורכי העבודה.

בתצורה העדכנית יש שלוש חלוקות: מטא דאטה עם 17 שדות מקוריים בוייטנאמית לכל מסמך, קובץ תוכן שמכיל את הטקסט המלא כמחרוזת HTML גולמית, וגרף קשרים של למעלה ממיליון חיבורים המגדירים תיקונים, ביטולים וציטוטים בין מסמכים. לצד אלה קיימות שתי תצורות ישנות שמכילות מעל חצי מיליון מסמכים בטקסט נקי, עם שמות שדות באנגלית אך עם מבנה נתונים שטוח יותר.

מתאים ל

  • אימון מודלי שפה למשפט

    לימוד ייצוגי שפה והבנת הנקרא על מסמכי חקיקה וצווים רשמיים בווייטנאמית.

  • בניית גרף ידע משפטי

    מעקב אחרי שרשראות ציטוטים, תיקוני חקיקה וביטולי צווים באמצעות גרף הקשרים.

  • מערכות שליפה ותמצות

    אימון מנועי RAG לחילוץ תשובות ותקצירים מתוך טקסטים רגולטוריים מורכבים.

איפה זה נופל

הנתונים הם תמונת מצב נקודתית ולא סנכרון חי, ולכן סטטוס התוקף המשפטי עלול לפגר אחרי המציאות. 732 מסמכים במטא דאטה מגיעים ללא תוכן טקסטואלי כי במקור הם קובצי PDF בלבד, ובגרף ההפניות יש מעל 17 אלף מזהי יעד שלא קיימים במאגר. כל התוכן הוא בוייטנאמית בלבד, כך שלמפתחים ישראלים אין כאן שום נגיעה לעברית, וצריך לנקות תגיות HTML לפני שמאמנים מודלים על התוכן העדכני.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא רישיון ייחוס חופשי, והמסמכים המקוריים הם ברשות הציבור לפי חוקי המידע בווייטנאם. הדרישה היחידה היא לתת קרדיט ליוצר המאגר.

האם יש במאגר טקסטים בעברית או באנגלית?

לא. כל המסמכים המשפטיים מנוסחים בווייטנאמית בלבד. בחלק מהתצורות הישנות שמות השדות תורגמו לאנגלית, אך גוף הטקסט נשאר וייטנאמי לחלוטין.

איך מחברים בין הטקסט המלא לפרטי המסמך?

מבצעים מיזוג לפי שדה המזהה הייחודי שקיים בכל הקבצים. חשוב לוודא שמתייחסים למזהה כמחרוזת טקסט ולא כמספר, עקב שינויים במבנה הנתונים בגרסה העדכנית.

מה ההבדל בין התצורה הרגילה לתצורת legacy?

הגרסה הישנה מכילה יותר מסמכים בטקסט פשוט אך עם פחות פירוט מטא דאטה. הגרסה החדשה מדויקת יותר ומכילה קשרי גומלין ו־HTML גולמי, אך מתפרסת על פחות רשומות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets על ידי ציון שם התצורה הרצויה, למשל metadata, content או relationships, ללא צורך בהרשאות גישה מיוחדות. שימו לב שבגרסה הנוכחית מזהי המסמכים הם מחרוזות ולא מספרים, כיוון שהם כוללים UUID וקידומות של הפורטל. כדי לחבר בין טקסט החוק לקשרים המשפטיים שלו, ממזגים בין השדה id במטא דאטה לבין doc_id בגרף הקשרים.

from datasets import load_dataset

ds = load_dataset("th1nhng0/vietnamese-legal-documents")

הרישיון

המאגר מופץ ברישיון קריאייטיב קומונס ייחוס 4.0, ומסמכי המקור עצמם מוגדרים ברשות הציבור לפי החוק בווייטנאם. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולאמן עליו מודלים, בתנאי שנותנים קרדיט מתאים ליוצר. אין חובה לשתף נגזרות באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗