GPT
S

synthetic_pii_finance_multilingual

קוד פתוח

gretelaiapache-2.02024-06-09

  • synthetic
  • PII
  • finance
  • full-documents

מסמכים פיננסיים סינתטיים באורך מלא עם תיוגי מידע מזהה בכמה שפות. מתאים למי שבונה מודלי זיהוי ישויות או סורקי אבטחה וצריך טקסט שנראה אמיתי בלי להסתבך עם דליפות פרטיות אמיתיות.

  • 1,798הורדות בחודש
  • 81לייקים

מה זה

המאגר מכיל 55,940 מסמכים פיננסיים סינתטיים מלאים, שמחולקים לסט אימון של 50,776 רשומות וסט בדיקה של 5,164 רשומות. הטקסטים מכסים 100 סוגי מסמכים פיננסיים שונים, כמו הודעות דואל, דוחות כספיים ופניות תמיכה, עם 20 תתי סוגים לכל פורמט. האורך הממוצע של כל מסמך עומד על 1,357 תווים, ויש בו תיוגים לטווחים מדויקים של 29 סוגי מידע מזהה שונים, כולל שמות, מספרי כרטיסי אשראי, קודי בנק וכתובות רשת.

הטקסטים נוצרו באמצעות מודלי שפה מסדרת Mistral דרך Gretel Navigator, ולא נאספו מחברות אמיתיות. לאחר היצירה, החברה איתרה ותייגה את נתוני הפרטיות בעזרת ספריית זיהוי הישויות GLiNER כדי לתפוס גם פרטים שהמודל פלט מעבר להנחיות המקוריות.

שלב הסינון התבסס על שופט מבוסס מודל שפה, שדירג כל מסמך בחמישה ציונים של איכות, תאימות, עובדתיות, רעילות והטיה. רשומות עם ציוני רעילות או הטיה מעל 20, או ציוני איכות, התאמה ועובדתיות מתחת ל־80, נזרקו החוצה. חלק קטן מהנתונים עבר בדיקה ידנית מדגמית בידי אדם.

מתאים ל

  • אימון מודלי זיהוי ישויות

    לימוד מודלים לאיתור טווחי מידע אישי בטקסטים פיננסיים לפי 29 סוגי ישויות שונות.

  • הערכת כלי השחרת מידע

    בדיקת איכות של מנגנוני הסרת פרטים אישיים ממסמכים לפני שליחה למערכות חיצוניות.

  • מבחני עומס לסורקי אבטחה

    הרצת סריקות לגילוי דליפות מפתחות ונתוני בנק במסמכים ארוכים המדמים תיעוד ארגוני.

איפה זה נופל

הנתונים כולם נוצרו על ידי בינה מלאכותית, מה שאומר שהתיוגים עלולים להכיל טעויות זיהוי, תוצאות חיוביות שגויות או השמטות שהספרייה האוטומטית פספסה. הבדיקה האנושית הייתה מדגמית בלבד ואינה מכסה את כל החומר. מבחינת שפות, אנגלית שולטת ביותר ממחצית מהמאגר עם 28,910 מסמכים, בעוד ששפות אחרות כמו גרמנית, צרפתית והולנדית מקבלות סביב 4,500 מסמכים כל אחת. עברית אינה קיימת כאן כלל. בנוסף, המסמכים מייצגים מבנים פיננסיים כלליים, כך שדרישות רגולטוריות או תבניות מקומיות ספציפיות לא בהכרח יקבלו ייצוג נאמן למציאות.

שאלות
נפוצות

האם מותר להשתמש במידע כדי לאמן מודל מסחרי?

כן. הרישיון הוא Apache 2.0, שמאפשר שימוש מסחרי חופשי באימון מודלים ובפיתוח מוצרים. הדרישה היחידה היא השארת הודעת הקרדיט המקורית של היוצרים.

האם הדאטהסט כולל עברית?

לא. המאגר כולל שבע שפות בלבד: אנגלית, ספרדית, שוודית, גרמנית, איטלקית, הולנדית וצרפתית. אנגלית תופסת יותר מחצי מהרשומות.

איך נאספו הנתונים?

הנתונים לא נאספו ממקורות אמיתיים אלא נוצרו מאפס במודלי השפה Mistral 7B ו־Mixtral 8x7B. התיוגים הוצמדו אוטומטית בעזרת ספריית GLiNER ועברו סינון של שופט מבוסס מודל שפה.

איך מחולק סט הנתונים?

המאגר כולל 55,940 רשומות, מהן 50,776 בסט האימון ו־5,164 בסט הבדיקה. החלוקה בקבצים מסודרת לפי שפות, כאשר כל קובץ שמור כקובץ Parquet בודד לחלק הבדיקה וחלק האימון.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הנתונים באמצעות המזהה הרשמי שלו, בלי צורך בבקשת גישה מיוחדת או באישור ידני. הקבצים שמורים בפורמט Parquet ומחולקים לקובצי אימון ובדיקה נפרדים לפי שפות. השדות המרכזיים לעבודה הם generated_text שמכיל את הטקסט המלא, ו־pii_spans שמחזיק רשימת מחרוזות במבנה נתונים עם סוג הישות ומיקומי ההתחלה והסיום בתווים. שאר העמודות כוללות את סוג המסמך, הגדרות השפה וחמשת מדדי האיכות של הסינון האוטומטי.

from datasets import load_dataset

ds = load_dataset("gretelai/synthetic_pii_finance_multilingual")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המלא. מותר להשתמש בו לפרויקטים מסחריים ומחקריים, לשנות אותו, לאמן עליו מודלים פנימיים או מוצרים שנמכרים ללקוחות, ולשלב אותו בקוד סגור. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית של Gretel. אין חובה לחלוק מודלים שאומנו על הנתונים תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗