GPT
P

pii-masking-400k

קוד פתוח

ai4privacyother2024-08-29

  • legal
  • business
  • psychology
  • privacy
  • gdpr

מאגר טקסטים סינתטיים לחילוץ והסוואת פרטי זיהוי אישיים בשש שפות אירופיות. מתאים לאימון מודלי תיוג ישויות והסוואה לפלטפורמות שיחה ומערכות תמיכה.

  • 1,349הורדות בחודש
  • 63לייקים

מה זה

הנתונים כוללים 406,896 רשומות טקסט שנוצרו כולן באלגוריתמים סינתטיים קנייניים כדי למנוע דליפת פרטיות אמיתיים. כל רשומה כוללת את טקסט המקור, גרסה מוסתרת עם תגיות, מיקומי תווים מדויקים של הישויות וטוקניזציה מוכנה למודלי שפה רב לשוניים כמו mBERT עם תיוגי BIO. המאגר מחולק לשמונים אחוז אימון ועשרים אחוז ולידציה.

התוכן נבנה כדי לדמות שמונה אזורים גיאוגרפיים שונים, עם דגש חזק על מערב אירופה. השפות המובילות הן אנגלית, איטלקית, צרפתית וגרמנית, לצד ייצוג קטן יותר לספרדית והולנדית. המהדורה הציבורית מסמנת 17 מחלקות שונות של מידע מזהה מתוך 63 שקיימות בגרסה המורחבת של החברה.

מתאים ל

  • הסוואת שיחות בצ'אטבוט

    אימון מסווג להסרת שמות ופרטי קשר משיחות משתמשים בזמן אמת.

  • סינון מידע במערכות תמיכה

    זיהוי וטשטוש פרטים רגישים לפני שמסמכים מועברים לנציגים חיצוניים.

  • הכנת דאטה למחקר

    הסרת נתוני זיהוי מטקסטים רפואיים או עסקיים כדי לעמוד בתקנות פרטיות.

איפה זה נופל

הנתונים כולם סינתטיים ומיוצרים באלגוריתם, מה שאומר שהם סובלים מדפוסים מלאכותיים. הכותבים עצמם מודים בעמוד שיש שימוש מוזר בישויות זיהוי שטרם תוקן בגרסה הזו. בנוסף, חצי מהנפח מרוכז בלוקיישן של שוויץ ואין פה בכלל עברית או ייצוג מזרח תיכוני, כך שלמוצר מקומי המאגר לא יעזור ללא איסוף והתאמה נפרדים.

אותה משפחה

pii-masking יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח כלי מסחרי?

לא בלי הסכם. הרישיון מאפשר שימוש אקדמי עם ייחוס, אך גופים מסחריים נדרשים לפנות לחברה במייל ייעודי כדי להסדיר רישיון ושימוש בנתונים.

האם יש במאגר טקסטים בעברית?

אין במאגר עברית בכלל. הוא מכיל שש שפות בלבד: אנגלית, צרפתית, גרמנית, איטלקית, ספרדית והולנדית, עם התאמה לאזורי שיפוט אירופיים ואמריקאיים.

איך נאספו הטקסטים והאם יש סכנה לדליפת פרטיות אמיתית?

כל הטקסטים נוצרו בצורה סינתטית לחלוטין באמצעות אלגוריתמים ייעודיים. אין בנתונים מידע אישי אמיתי, ולכן אין חשש להפרת פרטיות של אנשים אמיתיים בעבודה עם הקבצים.

מה ההבדל בין המאגר הזה לגרסאות החדשות של הפרויקט?

מדובר בגרסה מוקדמת שמכילה כארבע מאות אלף רשומות ושבע עשרה מחלקות זיהוי. החברה כבר הוציאה מהדורות חדשות יותר שמגיעות ליותר ממיליון רשומות, עשרות שפות וכיסוי נרחב יותר של מחלקות מידע מזהה.

איך טוענים

הטעינה נעשית בפשטות דרך ספריית datasets באמצעות פקודת load_dataset ישירות מהמאגר, ללא צורך בהרשאת גישה מיוחדת. הקבצים שמורים בפורמט jsonl בחלוקה לספריות train ו validation. שימו לב שהאובייקטים המקוננים כמו תגיות ההסוואה שמורים כמחרוזות כדי למנוע בעיות תאימות, כך שצריך לפרסר אותם לפני העבודה עם מודלים של סיווג טוקנים או מודלי שפה מסוג Llama ו T5.

from datasets import load_dataset

ds = load_dataset("ai4privacy/pii-masking-400k")

הרישיון

הרישיון מוגדר תחת סיווג other ואינו פתוח לחלוטין. שימוש אקדמי ומחקרי מותר תחת מתן ייחוס, אך שימוש מסחרי דורש פנייה ישירה אל החברה לקבלת רישיון מתאים. המשמעות היא שאסור לאמן עליו מודלים למוצר מסחרי ללא הסכם מולם.

הרישיון המלא ב־Hugging Face ↗