GPT
P

pii-masking-200k

קוד פתוח

ai4privacyרישיון לא דווח2023-11-06

  • legal
  • business
  • psychology
  • privacy

מאגר נתונים סינתטי לזיהוי והסתרת מידע מזהה בטקסטים, בארבע שפות אירופיות ועם תיוגים מוכנים למודלי שפה. הוא מיועד למי שבונה מודלי אנונימיזציה לצ'אטים ומערכות שירות.

  • 2,928הורדות בחודש
  • 126לייקים

מה זה

המאגר מכיל כמאתיים ותשעה אלף משפטים שמדמים פניות של משתמשים לעוזרי בינה מלאכותית, מסמכים רשמיים, שיחות והודעות דואל. הטקסטים מפוזרים על פני מאתיים עשרים ותשעה נושאים מתחומי המשפט, העסקים, החינוך והפסיכולוגיה. כל הנתונים נוצרו באופן סינתטי באמצעות אלגוריתמים קנייניים, ועברו בדיקה ואימות ידניים על ידי בני אדם כדי לוודא שאינם חושפים פרטיות אמיתית.

התוכן מחולק לקבצי טקסט לפי שפות: אנגלית עם ארבעים ושלושה אלף פריטים, צרפתית עם שישים ושניים אלף, גרמנית עם חמישים ושניים אלף, ואיטלקית עם חמישים אלף. כל רשומה כוללת את המשפט הגולמי, גרסה נקייה עם מסכות במקום המידע הרגיש, מיפוי המיקומים של הישויות, תיוגי טוקנים בפורמט ביאו, וטוקניזציה שמותאמת לאימון מודלים ממשפחת ברט.

מתאים ל

  • הסתרת פרטים בצ'אטבוטים

    אימון מסווגים להסרת שמות, כתובות ופרטי חשבון משיחות משתמשים עם עוזרים אישיים.

  • סינון מידע רגיש בתמיכה

    מחיקת מידע אישי מפניות שירות ומסמכים משפטיים לפני שהם מועברים לעיבוד נוסף.

  • אימון מודלי חילוץ ישויות

    הזנת תיוגי הטוקנים ישירות למודלי שפה לאיתור ישויות מזהות לפי מיקומן בטקסט.

איפה זה נופל

הנתונים סינתטיים לגמרי, ולכן הם לא משקפים שגיאות כתיב, ניסוחים עילגים או סלנג טבעי של אנשים אמיתיים. הכרטיס מציין במפורש חוסר איזון פנימי, כשהמחלקה של שמות פרטיים מופיעה בשכיחות יתר קיצונית ביחס לחמישים ושלוש המחלקות האחרות. עברית חסרה לחלוטין, והמאגר מוגבל רק לאנגלית, גרמנית, צרפתית ואיטלקית. בנוסף, המפרסמים עצמם הוציאו גרסאות חדשות ומקיפות יותר שמחליפות אותו, כך שזהו אינו השחרור העדכני ביותר שלהם.

אותה משפחה

pii-masking יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

השדה של הרישיון במאגר מסומן כלא דווח, אך קיימים קבצי רישיון בתוך התיקייה. מבחינה משפטית מומלץ לקרוא את תוכן הקובץ ישירות לפני שמתחילים לאמן מודלים לשימוש מסחרי, כיוון שההרשאה אינה מוצהרת בבירור בכרטיס.

האם יש תמיכה בעברית?

המאגר כולל ארבע שפות בלבד: אנגלית, צרפתית, גרמנית ואיטלקית. טקסטים בעברית אינם נכללים כאן, ולכן הוא לא מתאים לאימון מודלים לזיהוי מידע רגיש בשפה המקומית.

מאיפה הנתונים הגיעו והאם קיימת סכנת פרטיות?

כל הטקסטים נוצרו באופן סינתטי בעזרת אלגוריתמים ייעודיים של החברה, ולא נלקחו מאנשים אמיתיים. לאחר מכן הם עברו אימות ידני על ידי בודקים אנושיים, כך שאין חשש להפרת פרטיות אמיתית משימוש בהם.

האם זהו הדאטהסט המעודכן ביותר בתחום?

לא, היוצרים עצמם מציינים כי קיימות גרסאות דגל חדשות יותר שהרחיבו את המאגר למיליון ומיליון וחצי דוגמאות. הגרסאות החדשות מכילות עשרות שפות נוספות, ולכן שווה לבדוק אותן לפני שמתחילים לעבוד עם גרסת המאתיים אלף.

איך טוענים

טוענים את המאגר ישירות בספריית הדאטהסטס של האגינג פייס בעזרת הפקודה load_dataset עם המזהה המלא. הגישה חופשית ואינה דורשת אישור מיוחד או הרשמה מראש. הקבצים שמורים בפורמט jsonl וכוללים שדות מרכזיים כמו source_text, target_text, span_labels, וכן mbert_bio_labels. שימו לב שהאובייקטים המקוננים ברשומות שמורים כמחרוזות טקסט כדי לשמור על תאימות, ולכן תצטרכו להמיר אותם למבני נתונים בקוד לפני האימון.

from datasets import load_dataset

ds = load_dataset("ai4privacy/pii-masking-200k")

הרישיון

בעמוד המאגר מופיע שהרישיון לא דווח, אף שקיים קובץ רישיון ייעודי בין הקבצים. היעדר הגדרה רשמית במטא-דאטה משאיר את תנאי השימוש המסחרי בעמימות משפטית. מפתח שמתכנן לאמן עליו מודל למוצר מסחרי חייב לבדוק ידנית את תוכן הקובץ המצורף לפני השימוש.

הרישיון המלא ב־Hugging Face ↗