GPT
G

gretel-pii-masking-en-v1

קוד פתוח

gretelaiapache-2.02024-10-14

  • datadesigner
  • synthetic
  • domain-specific
  • text
  • NER

שישים אלף מסמכים סינתטיים באנגלית עם תיוגי פרטיות ומידע רפואי רגיש. המטרה העיקרית שלו היא אימון מודלי חילוץ ישויות כמו גלינר לזיהוי והסתרת מידע מזהה.

  • 1,347הורדות בחודש
  • 46לייקים

מה זה

הנתונים נוצרו במלואם באופן סינתטי באמצעות המודל mistral-nemo-2407 דרך Gretel Navigator, ועברו אימות אוטומטי לאיכות ועקביות. כל רשומה כוללת מזהה ייחודי, תחום עיסוק, סוג מסמך, תיאור מבנה המסמך, הטקסט המלא ורשימת ישויות רגישות מתויגות מתוכו לפי סוגים.

המאגר מחולק לשלושה חלקים מוכנים. חמישים אלף רשומות שמורות לאימון, חמשת אלפים לוולידציה וחמשת אלפים לבדיקה. החלוקה מכסה מגוון של עשרות עולמות תוכן, כולל בריאות, פיננסים, סייבר ומשפטים, ומכילה עשרות סוגי ישויות החל ממספרי תיקים רפואיים ותאריכי לידה ועד כתובות ומספרי ביטוח לאומי אמריקאיים.

מתאים ל

  • אימון מודלי גלינר

    התאמת מודלים לאיתור ישויות רגישות במסמכים ארגוניים באנגלית לפי שדות ותיוגים מובנים.

  • מיסוך מידע רפואי

    זיהוי אוטומטי והסרה של פרטי מטופלים ומספרי תיקים רפואיים מתוך סיכומי מחלה ודוחות.

  • הערכת ביצועי זיהוי ישויות

    בדיקת איכות של מנגנוני זיהוי מידע אישי על גבי חמשת אלפי מסמכי המבחן המוכנים.

איפה זה נופל

הטקסט כולו באנגלית בלבד. אם אתם בונים מנגנון לזיהוי מידע מזהה בישראל, תבניות כמו מספרי זהות ישראליים, כתובות מקומיות וטקסט בעברית פשוט לא קיימות כאן. בנוסף, מדובר בדאטה סינתטי לחלוטין שנוצר על ידי מודל שפה, ולכן עלול לפספס ניסוחים משובשים, שגיאות הקלדה אמיתיות או מבנים לא צפויים שמופיעים במסמכים אנושיים בשטח. כדאי גם לשים לב להתפלגות הישויות. יש המון מספרי תיק רפואי ותאריכי לידה, אבל מעט מאוד קודים כמו סי וי וי או סיסמאות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן. הרישיון הוא אפאצ'י שתיים אפס, והוא מאפשר שימוש מסחרי מלא כולל אימון מודלים המוטמעים במערכות מסחריות. התנאי העיקרי הוא מתן קרדיט ושמירה על תנאי הרישיון המקוריים.

האם הדאטהסט מתאים לעבודה עם מסמכים בעברית?

לא. כל שישים אלף המסמכים במאגר נוצרו באנגלית בלבד. הוא לא מכיל ישויות שרלוונטיות לישראל כמו תעודות זהות מקומיות, מספרי טלפון ישראליים או כתובות בארץ.

איך נוצר המידע שבמאגר?

המסמכים יוצרו במלואם באופן סינתטי על ידי גרייטל באמצעות מודל השפה mistral-nemo-2407. הם עברו תהליכי אימות אוטומטיים לאיכות, והתיוגים מובנים כחלק מתהליך היצירה.

האם צריך להפריד את הנתונים לבדיקה ואימון לבד?

אין צורך לבצע חלוקה עצמאית. המאגר מגיע מחולק מראש לשלושה קובצי פרקט של חמישים אלף רשומות לאימון, חמשת אלפים לוולידציה וחמשת אלפים לטסט.

איך טוענים

הנתונים שמורים בקובצי פרקט ומחולקים מראש לקבצים נפרדים של אימון, וולידציה ובדיקה. המאגר פתוח לחלוטין ואינו דורש אישור גישה מוקדם או הגדרת הרשאות. בעת הטעינה, השדות הקריטיים לעבודה הם שדה הטקסט שמרכז את תוכן המסמך ושדה הישויות שמרכז את התיוגים הרלוונטיים לחילוץ.

from datasets import load_dataset

ds = load_dataset("gretelai/gretel-pii-masking-en-v1")

הרישיון

הרישיון הוא אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו במוצרים. אין חובת שיתוף של הנגזרות באותו רישיון. נדרש לשמור על הודעות זכויות היוצרים והייחוס המקוריות. מודל שאומן על המאגר אינו מוגבל ברישיון זה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗