GPT
P

pii-masking-300k

קוד פתוח

ai4privacyother2024-03-27

  • legal
  • business
  • psychology
  • privacy
  • gdpr

מאגר נתונים סינתטי לזיהוי והסתרת מידע מזהה בשש שפות אירופיות. מיועד למי שרוצה לאמן מודלים להגנה על פרטיות בלי להסתכן בחשיפת פרטים של אנשים אמיתיים.

  • 5,274הורדות בחודש
  • 116לייקים

מה זה

הרשומות מכילות טקסטים מלאכותיים שנוצרו באלגוריתמים קנייניים, ועברו בדיקות איכות שכללו אימות אנושי. כל שורה היא אובייקט עם טקסט מקור שמכיל פרטים אישיים, גרסה מוסתרת שבה המידע הוחלף בתגיות, ומיפוי מדויק של תגיות לפי מיקומים ותגיות תואמות מודלי שפה. המאגר מכוון לתרחישי שיחה מתחומי החינוך, הבריאות והפסיכולוגיה עם עשרים ושבע מחלקות שונות של מידע רגיש.

המבנה הכולל מחולק לשני תתי מאגרים, OpenPII וגרסה ממוקדת ביטוח ופיננסים בשם FinPII שמוסיפה מחלקות ייעודיות לתחום. הנתונים מתפרסים על שש שפות עיקריות, אנגלית, צרפתית, גרמנית, איטלקית, הולנדית וספרדית, עם התאמה לשמונה תחומי שיפוט מקומיים כמו שווייץ, ארצות הברית ובריטניה. החלוקה הפנימית המוגדרת מראש עומדת על שבעים ותשעה אחוזים לאימון ועשרים ואחד אחוזים לוולידציה.

מתאים ל

  • סיווג טוקנים לזיהוי ישויות

    אימון מודלים מבוססי רוברטה או ברט לסימון חלקי טקסט שמכילים פרטים אישיים רגישים.

  • הסתרת מידע בצ'אטבוטים

    ניקוי אוטומטי של שמות, זמנים ופרטים מזהים מתוך שיחות משתמשים ותמיכה טכנית.

  • התאמת מודלי ג'נרטיב למסוך

    כוונון עדין של מודלי T5 או לאמה לתרגום ישיר של טקסט חשוף לגרסה ממוסכת.

איפה זה נופל

היוצרים מודים בשגיאות תיוג סביב ישויות כלליות ורחבות מדי, כמו שמות של מדינות כמו שווייץ, תאריכים, זמנים ותארים כמו דוקטור, שלעיתים מפוספסים או מתויגים לא נכון. הדגימה הידנית שנבדקה מוגבלת מאוד וכללה רק 216 רשומות, כך שרמת הדיוק המוצהרת של 98.3% נשענת על מדגם זעיר. בנוסף, אין במאגר עברית כלל, והטקסטים מותאמים בעיקר להקשרים מערב אירופיים ואמריקאיים. מאחר שהנתונים סינתטיים, שפה טבעית מורכבת של משתמשים אמיתיים עלולה להתנהג אחרת לחלוטין בפועל.

אותה משפחה

pii-masking יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא באופן ישיר וללא אישור. המאגר מיועד במקור לשימוש אקדמי עם ייחוס מתאים, וחברות מסחריות נדרשות לפנות במייל לצוות לקבלת רישיון מסחרי מסודר.

האם המאגר כולל תמיכה בעברית?

לא, אין בו עברית. הוא כולל שש שפות בלבד: אנגלית, צרפתית, גרמנית, איטלקית, הולנדית וספרדית, עם לוקליזציה לשמונה תחומי שיפוט במערב.

האם הטקסטים מכילים מידע אמיתי של אנשים שנלקח מהרשת?

לא, מדובר בנתונים סינתטיים שנוצרו באלגוריתמים קנייניים של החברה. המטרה של הגישה הזו היא למנוע פגיעה בפרטיות של אנשים אמיתיים בעת אימון מודלים.

איך טוענים

טוענים את המאגר ישירות בספריית datasets בעזרת מזהה המאגר ai4privacy/pii-masking-300k, בלי צורך בטופס בקשת גישה מקדים. הנתונים מאוחסנים בקובצי jsonl לפי שפות, כגון אנגלית, צרפתית, גרמנית, איטלקית והולנדית. שדות המפתח החשובים לעבודה הם source_text, target_text, מערך התוויות privacy_mask ורשימות הטוקנים עבור סיווג ישיר. שימו לב שאובייקטים מקוננים נשמרים כמחרוזות טקסט, כך שצריך לפרסר אותם בקוד לפני שמתחילים לאמן.

from datasets import load_dataset

ds = load_dataset("ai4privacy/pii-masking-300k")

הרישיון

הרישיון מוגדר בתור רישיון מותאם אישית ולא חופשי. שימוש אקדמי מותר בכפוף לציטוט מתאים ותחת תנאים דומים, אך גופים מסחריים שרוצים להשתמש במאגר, לגשת לנתונים נוספים או להפיק ממנו מודלים למוצרים נדרשים לפנות ישירות לכתובת licensing@ai4privacy.com להסדרת רישוי.

הרישיון המלא ב־Hugging Face ↗