GPT
P

presidio_demo

רץ בדפדפן

presidiomit2023-04-04

  • docker

מזינים טקסט חופשי ומקבלים זיהוי והסוואה של פרטים מזהים ורפואיים. זה מיועד למפתחים וחוקרים שרוצים לבחון מודלים של פרטיות בלי להתקין סביבה מקומית.

  • הורדות בחודש
  • 152לייקים

מה זה

מדביקים טקסט באנגלית ומקבלים סימון של ישויות רגישות כמו שמות, כתובות או נתונים רפואיים, לצד גרסה מושחרת או מוחלפת של הקטע. הממשק נותן לבחור אילו מזהים לחפש ולראות בדיוק מה אותר ובאיזה ציון ביטחון.

מאחורי הקלעים רץ שילוב של מודלי שפה וזיהוי ישויות שונים. הרשימה כוללת את spacy הוותיק בגרסת en_core_web_lg, לצד מודלי GLiNER של nvidia ו־knowledgator, מודל flair, וגרסאות ייעודיות לטקסט רפואי וקליני של OpenMed. זה נותן תמונה ברורה על איך מודלים שונים מתמודדים עם אותו קטע טקסט.

מתאים ל

  • בדיקת הסוואת מידע רפואי

    מזינים סיכומי מחלה באנגלית כדי לראות איך המודלים של OpenMed מזהים ומחביאים פרטי מטופלים.

  • השוואת מנועי זיהוי ישויות

    מריצים את אותו הטקסט מול GLiNER ומול spaCy ובודקים מי מהם מדייק יותר בזיהוי פרטים אישיים.

  • הדגמת אנונימיזציה לצוות

    מציגים למפתחים איך טקסט גולמי הופך לטקסט מנוקה בלי צורך להרים שרת בדיקות ייעודי.

איפה זה נופל

ההדגמה מיועדת בעיקר לטקסט באנגלית ולא מכילה תמיכה מובנית בעברית או בהקשרים ישראליים כמו תעודות זהות מקומיות. חוץ מזה, החומרה החלשה מיועדת לבדיקות נקודתיות של משפטים בודדים, ולא תעמוד בניתוח של מסמכים שלמים או קבצים כבדים ברצף.

שאלות
נפוצות

האם השימוש בהדגמה עולה כסף?

לא, הגישה בדפדפן פתוחה וחינמית לחלוטין. אין צורך בחשבון, בתשלום או במפתח api כדי להריץ בדיקות.

האם המידע שלי נשמר בשרת?

הטקסט נשלח לעיבוד על גבי שרת ציבורי של hugging face. בגלל שמדובר בכלי אבטחה, עדיף להדביק רק מידע מומצא או דוגמאות בדיקה ולא נתונים אישיים אמיתיים.

אפשר להריץ את המערכת הזו על מחשב מקומי?

כן, הקוד מבוסס על מאגר ה־docker הפתוח של הפרויקט. אפשר להוריד את הקבצים ולהרים את ממשק ה־streamlit עצמאית בלי תלות ברשת.

האם המערכת יודעת לעבוד עם עברית?

המודלים בהדגמה הזו, כמו en_core_web_lg ו־ner-english-large, מאומנים על אנגלית. לצורך עבודה מול טקסט עברי תצטרכו להגדיר מודלים תומכים בהתקנה עצמאית.

איך משתמשים

נכנסים לעמוד בדפדפן, מדביקים את הטקסט לתיבה, בוחרים את המודל הרצוי ומריצים. אין צורך בהרשמה או בהזנת פרטי אשראי כדי לנסות.

הקוד רץ בתוך קונטיינר docker על חומרת cpu-basic בסיסית. זה אומר שעיבוד של קטעים ארוכים או מעבר למודלים הכבדים יותר כמו flair או SuperClinical של 434 מיליון פרמטרים יכול לקחת כמה שניות טובות לכל בדיקה.

הרישיון

הפרויקט מופץ תחת רישיון mit, שמאפשר שימוש חופשי לחלוטין כולל שימוש מסחרי והתאמה של הקוד. עם זאת, כל טקסט שאתם מדביקים בהדגמה הציבורית עובר דרך השרת של hugging face, כך שלא כדאי להזין מידע רגיש אמיתי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗