GPT
G

gliner-PII

קוד פתוח

nvidiaother2025-08-29

  • gliner
  • pytorch
  • nvidia
  • PII
  • PHI

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

זיהוי פרטיות בטקסט בלי להרים מודל שפה ענק. המודל שולף כתובות, שמות ופרטים רגישים עם ציון ביטחון ומיקום מדויק, כשהוא מתמקד בביצועים מהירים על גבי מעבד או כרטיס גרפי פשוט.

  • 1.7 GBמשקל הקבצים
  • 9,577הורדות בחודש
  • 158לייקים

מה זה

מדובר במודל סיווג ישיר שמבוסס על ארכיטקטורת GLiNER וכולל 570 מיליון פרמטרים. הוא לא מייצר טקסט חדש ולא ממציא תשובות, אלא סורק את המחרוזת ומחזיר רשימה של ישויות עם נקודות התחלה, סיום, סוג הישות וציון ביטחון. המטרה שלו היא איתור מידע מזהה כמו מספרי תעודות זהות, פרטי חשבון, כתובות מייל ומידע רפואי ביותר מ־55 קטגוריות שונות, מתוך טקסטים מובנים או חופשיים.

האימון נעשה על דאטה־סט סינתטי של כמאה אלף רשומות מבית אנבידיה, שמכסה תבניות בינלאומיות ואמריקאיות. במבחנים מול מאגרי בדיקה חיצוניים התוצאות מגלות תמונה מעורבת. על הדאטה הסינתטי של אנבידיה הוא מגיע לציון F1 של 0.87, אבל על דאטה־סטים כמו Argilla ו־AI4Privacy התוצאה צונחת ל־0.70 ול־0.64 תחת סף זיהוי של 0.3. המשמעות ברורה, הוא מזהה מצוין דפוסים שדומים לדאטה שבו אומן, אבל על טקסטים מגוונים מהעולם האמיתי הוא מפספס לא מעט ישויות.

מתאים ל

  • ניקוי קבצי לוגים

    מחיקת כתובות מייל, שמות משתמש ופרטי גישה מתוך לוגים של שרתים לפני שליחתם למערכות ניטור חיצוניות.

  • אנונימיזציה למסמכים

    זיהוי פרטי חשבון ומסמכים מזהים בחוזים ובמסמכים פיננסיים לפני עיבוד או שמירה בענן.

  • סינון תוכן משתמשים

    סריקה מהירה של תגובות וטקסט חופשי באתרים כדי לחסום פרסום מספרי טלפון ופרטים אישיים.

איפה זה נופל

הבעיה המרכזית שלו היא ביצועים בינוניים למדי על נתונים אמיתיים. ציוני F1 שנעים בין 0.64 ל־0.70 במבחנים חיצוניים מעידים על כמות משמעותית של פספוסים או אזעקות שווא, במיוחד אם מסתמכים עליו לציות עיוור לתקני פרטיות. אנבידיה מצהירה במפורש שהביצועים משתנים לפי תחום ומבנה המסמך וממליצה על בדיקה אנושית במקרים קריטיים. בנוסף, המודל אומן על אנגלית בלבד ולא מיועד לטפל בטקסטים בעברית.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית?

לא מומלץ בכלל. המודל הוגדר ואומן על השפה האנגלית בלבד, וכל הדאטה הסינתטי שלו בנוי לפי תבניות בינלאומיות ואמריקאיות. הוא לא יזהה מספרי תעודות זהות ישראליות או שמות בעברית בצורה אמינה.

איך קובעים את סף הזיהוי הנכון בזמן הריצה?

בתיעוד מוצגת דוגמה עם סף של 0.5 לעומת בדיקות הבנצ'מרק שבוצעו עם סף של 0.3. ככל שתורידו את הסף תקבלו יותר זיהויים אבל גם יותר אזעקות שווא, לכן חובה לבדוק מדגם נתונים אמיתי שלכם כדי לכוונן את המספר.

איך מריצים

ההרצה נעשית דרך ספריית פייתון ייעודית בשם gliner יחד עם PyTorch. מעבירים למודל את הטקסט ומערך של תוויות שרוצים לאתר, למשל מספרי טלפון או שמות משתמש, יחד עם סף ביטחון מבוקש. המודל מחזיר ישירות את חיתוך המילים והאינדקסים שלהן.

במשקל של 1.7 גיגה־בייט ועם חצי מיליארד פרמטרים, הדרישות שלו צנועות מאוד. הוא רץ היטב על מעבדי x86_64 סטנדרטיים ועל כרטיסי מסך מכל הדורות האחרונים של אנבידיה, החל מ־Pascal הוותיק ועד Blackwell. אין כאן צורך בשרת מפלצתי או ב־API חיצוני, ואפשר להריץ אותו ישירות בתוך הקוד שלכם בעלויות תשתית זניחות.

pip install -U huggingface_hub
hf download nvidia/gliner-PII

הרישיון

השימוש כפוף לרישיון NVIDIA Open Model License Agreement. הרישיון מאפשר שימוש מסחרי ובלתי מסחרי כאחד, כך שמותר לשלב אותו במערכות פנימיות או במוצרים שמוכרים ללקוחות, בכפוף לתנאים המשפטיים של אנבידיה.

הרישיון המלא בעמוד המודל ↗