GPT
G

gliner_multi_pii-v1

קוד פתוח

urchadeapache-2.02024-04-20

  • gliner
  • pytorch
  • token-classification
  • en
  • fr

מודל קטן לזיהוי ישויות שמתמחה באיתור מידע מזהה בכמה שפות. הוא מאתר שמות, תעודות ופרטי אשראי ישירות מתוך הטקסט בלי לשלוח בקשות יקרות למודלי ענק.

  • 1.1 GBמשקל הקבצים
  • 58,157הורדות בחודש
  • 173לייקים

מה זה

במקום להריץ מודל שפה כבד כדי לחלץ פרטים אישיים או להיתקע עם מודל ישויות רגיל שמוגבל לקטגוריות קבועות מראש, יש כאן פתרון ממוקד. הבסיס שלו הוא מקודד דו כיווני דמוי ברט שעבר אימון נוסף על נתונים סינתטיים שנוצרו עם מיסטרל, במטרה ספציפית לתפוס מזהים אישיים.

הוא יודע לזהות עשרות סוגי ישויות שקשורות לפרטיות, החל ממספרי טלפון, מיילים, וכתובות, ועד לנתונים רגישים כמו תרופות, מצבים רפואיים, מספרי דרכון, כרטיסי אשראי, וקודי אבטחה. מכיוון שהוא מבוסס על ארכיטקטורת גלינר, אתם מעבירים לו בזמן הריצה את רשימת התוויות שמעניינת אתכם מתוך הטקסט, והוא מסמן אותן ישירות.

מתאים ל

  • אנונימיזציה של מסמכים

    מחיקת מספרי זהות, תעודות ופרטי קשר מקבצים באנגלית ובשפות אירופיות לפני שמירה בארכיון.

  • סינון קלט למודלי שפה

    ניקוי כרטיסי אשראי, שמות וכתובות מפניות משתמשים כדי לא לשלוח מידע רגיש לספקי צד שלישי.

  • איתור מידע רפואי רגיש

    זיהוי שמות של תרופות ומצבים רפואיים מתוך טקסטים חופשיים כדי להגן על פרטיות מטופלים.

איפה זה נופל

המודל אומן על מידע סינתטי שנוצר במודל שפה, מה שאומר שהוא עלול לפספס תבניות אמיתיות שלא הופיעו בדאטה המיוצר. בנוסף, רשימת השפות הנתמכות כוללת רק אנגלית, צרפתית, גרמנית, ספרדית, פורטוגזית ואיטלקית. עברית לא מופיעה שם, ולכן אם הטקסטים שלכם כוללים שמות או מזהים בעברית, הוא כנראה יפספס אותם או יחזיר זיהויים שגויים. חובה לבדוק אותו על מדגם אמיתי שלכם לפני שסומכים עליו בתהליכי מחיקת מידע.

שאלות
נפוצות

האם המודל מתאים לזיהוי מידע מזהה בטקסטים בעברית?

השפות שנתמכות רשמית הן אנגלית, צרפתית, גרמנית, ספרדית, פורטוגזית ואיטלקית בלבד. עברית אינה חלק מהאימון של המודל הזה, ולכן לא מומלץ להסתמך עליו לטקסטים מקומיים בלי לבדוק אותו קודם.

האם חייבים להשתמש בכל עשרות התוויות שהוא מכיר?

לא. אתם בוחרים ומגדירים בקוד רק את התוויות הרלוונטיות לבקשה הנוכחית שלכם, כמו שמות וטלפונים בלבד, והוא יחפש רק אותן.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.1 גיגה בייט, כך שאפשר להריץ אותו בקלות על מעבד רגיל של שרת פשוט בלי מאיץ גרפי בכלל. כל מה שצריך זה להתקין את ספריית gliner בפייתון, לטעון את המשקלים מראש, ולקרוא לפונקציית החיזוי עם הטקסט ורשימת התוויות שרוצים לאתר.

אין סיבה לשלם על שירותי ענן חיצוניים או לשלוח מידע רגיש לצד שלישי כשהמשקל כזה נמוך. הוא נטען במהירות לזיכרון המקומי ומחזיר תוצאות מקומיות בתוך התשתית שלכם.

pip install -U huggingface_hub
hf download urchade/gliner_multi_pii-v1

הקבצים

4 קבצים במאגר, 1.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא אפאצ'י 2.0, שזה רישיון קוד פתוח מתירני מאוד. מותר להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו בחופשיות. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗