GPT
G

gliner-pii-large-v1.0

קוד פתוח

knowledgatorapache-2.02025-09-24

  • gliner
  • pytorch
  • onnx
  • NER
  • GLiNER

זיהוי מידע רגיש ואישי בריצת זירו שוט מקומית, בלי לקרוא לשרתים חיצוניים. הוא מחזיר ישויות מדויקות לפי שמות שאתם מגדירים בריצה, ומגיע מוכן למשימות אבטחה באנגלית.

  • 3.9 GBמשקל הקבצים
  • 14,314הורדות בחודש
  • 40לייקים

מה זה

הארכיטקטורה מבוססת על טרנספורמר דו כיווני לסיווג טוקנים שמקבל טקסט ורשימת תוויות חופשית בו זמנית. בניגוד למודלי זיהוי ישויות קלאסיים שמוגבלים לקטגוריות שנצרבו מראש, כאן מגדירים בזמן אמת מה לחפש, כמו שמות, מספרי כרטיסי אשראי או תעודות זהות אמריקאיות, והוא מסמן את המיקומים בטקסט.

המודל כולל התאמה מראש ליותר משישים קטגוריות נתונים רגישים מתחומי הרפואה, הפיננסים והזיהוי האישי. בבנצ'מרק הסינתטי של המפתחים מול גרסאות קטנות יותר, גרסת הלארג' רשמה 87.42% דיוק ו־79.4% ריקול, עם מדד משוקלל של 83.25%. בפועל, זה אומר שהוא מזהה פחות התראות שווא משאר הגרסאות בסדרה, אבל עדיין מפספס כחמישית מהישויות בטקסטים מורכבים.

מתאים ל

  • הסרת פרטים משיחות מוקלטות

    מחיקת שמות, מספרי כרטיסי אשראי וטלפונים מתמלולים באנגלית לפני שמירה במאגר נתונים פנימי.

  • אנונימיזציה של תיקים רפואיים

    זיהוי שמות מטופלים, תאריכי שחרור ותרופות לפי עשרות תוויות מוגדרות מראש לתחום הבריאות.

  • ניקוי יומני שרת וצ'אטים

    החלפת סיסמאות, כתובות איפי ומזהי משתמש במחרוזות גנריות לפני שליחת לוגים לצוותי פיתוח.

איפה זה נופל

הנתונים והאימונים נשענים על שפה אנגלית בלבד, כך שטקסטים בעברית פשוט לא יעבדו בלי אימון מחדש. בנוסף, הריקול שלו עומד על 79.4%, מה שאומר שהוא מחמיץ ישויות רגישות באחד מכל חמישה מקרים בממוצע, נתון בעייתי למערכות שדורשות אנונימיזציה הרמטית לפני שמירה במאגר.

יש גם סתירה פנימית בתיעוד של היוצרים, שטוענים בטקסט שגרסת הבסיס השיגה את התוצאה הכוללת הטובה ביותר, בזמן שבטבלה שלהם גרסת הלארג' מובילה. חובה לבצע בדיקות סף על הדאטה הספציפי שלכם כדי לכייל את ערך הביטחון הנדרש לפני שמעלים אותו לפרודקשן.

שאלות
נפוצות

האם המודל מזהה מספרי זהות ישראליים או כתובות בישראל?

לא. המודל אומן על נתונים באנגלית וכולל דפוסים אמריקאיים בעיקר, כמו מספרי ביטוח לאומי מקומיים ורישיונות נהיגה זרים. כדי לזהות פרטים ישראליים צריך לאמן מודל ייעודי או להסתמך על ביטויים רגולריים.

מה עדיף לפרודקשן, פייתון רגיל או ייצוא לקובץ אחר?

אם הביצועים קריטיים, ייצוא לפורמט ONNX בשילוב ספריות כמו Rust מאפשר עבודה מהירה בהרבה מהריצה הרגילה בפייתון. התיעוד מציין שיפור משמעותי בזמני תגובה בריצה מכווצת במעבד או במאיץ גרפי.

איך מריצים

טוענים אותו ישירות דרך ספריית הפייתון gliner, או מייצאים אותו לפורמט ONNX בריצות מהירות יותר בסביבות Rust, C++ ודפדפן. משקל הקבצים עומד על 3.9 גיגה בייט, כך שצריך כרטיס מסך עם לפחות שמונה גיגה זיכרון כדי לעבד באצ'ים בנוחות, או מעבד חזק אם משתמשים בקוונטיזציה של FP16 או UINT8 שמוזכרת בתיעוד.

אם אתם רצים על שרתים פנימיים ורוצים להימנע מדליפת מידע החוצה, הריצה המקומית פותרת את בעיית הפרטיות מול שירותי ענן. מנגד, אם העומס שלכם נמוך ומשתנה, או שאין לכם חומרה ייעודית, ניהול שרת למודל בגודל הזה ידרוש משאבים שלא תמיד מצדיקים את עצמם מול קריאה לשרת מנוהל.

pip install -U huggingface_hub
hf download knowledgator/gliner-pii-large-v1.0

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי לחלוטין, כולל שינוי הקוד והפצה פנימית או מסחרית בתוך מוצרים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים הלאה, בלי דרישה לפתוח את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗