GPT
L

LFM2.5-Encoder-350M-PII-Detector

קוד פתוח

LiquidAIother2026-06-12

  • transformers
  • safetensors
  • lfm2
  • token-classification
  • liquid

מודל קומפקטי שמזהה ארבעים סוגי מידע אישי רגיש בטקסט ארוך. הוא מיועד לסינון והשחרת פרטים רגישים בלי להוציא מידע מחוץ לשרת שלכם.

  • 355Mפרמטרים
  • 128,000טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 6,692הורדות בחודש

מה זה

מדובר במודל אנקודר בגודל 355 מיליון פרמטרים שמבצע סיווג ברמת הטוקן. הוא אומן לזהות 40 סוגי מידע אישי ב־11 תחומים, החל משמות, תעודות זהות וכרטיסי אשראי, ועד מפתחות API, סיסמאות ורשומות רפואיות. השילוב בין גודל קטן לחלון הקשר ענק של 128 אלף טוקנים מאפשר להזין אליו מסמכים שלמים, חוזים או לוגים ארוכים בלי לחתוך אותם לחתיכות קטנות.

במדדים שפורסמו הוא מציג תוצאות חזקות מול מודלים מתחרים כמו GLiNER או המסננים של OpenAI. במבחני Gretel ו־TAB הוא מגיע לציון F1 חלקי של 0.88 ו־0.86, הרבה מעל כלים מבוססי ביטויים רגולריים שקרסו שם לגמרי. במבחן MAPA הוא השיג תוצאה נמוכה של 0.236 עקב חוסר התאמה בהגדרת תאריכים מול תאריכי לידה, אך כשבוחנים זיהוי ישויות כללי ללא התחשבות בסוג המדויק, הדיוק עולה ומספק מענה טוב להשחרת נתונים.

מתאים ל

  • השחרת לוגים של פיתוח

    זיהוי מפתחות API, סיסמאות וטוקני גישה בקבצי שרת ארוכים לפני שמירתם.

  • אנונימיזציה של מסמכים

    הסרת פרטי קשר, חשבונות בנק ושמות מטקסטים משפטיים ורפואיים רגישים.

  • סינון קלט למודלי שפה

    ניקוי מידע מזהה משאילתות של משתמשים לפני שהן נשלחות לשירותי צד שלישי.

איפה זה נופל

החיסרון הברור ביותר למפתח ישראלי הוא היעדר תמיכה בעברית. רשימת השפות כוללת שמונה שפות אירופיות ורוסית בלבד, כך שטקסט מקומי ידרוש בדיקה מחמירה או אימון המשך, וכרגע לא הייתי בונה עליו לזיהוי שמות ישראליים או מספרי זהות מקומיים.

בנוסף, הטעינה דורשת הרצת קוד חיצוני והפעלת סקריפט היברידי לפענוח התוצאות, מה שמסבך את האינטגרציה לעומת מודל סיווג רגיל. קיימת גם תופעה של בלבול בין סוגי ישויות דומים, כפי שנראה בציונים הנמוכים במבחן MAPA.

שאלות
נפוצות

האם המודל מתאים לזיהוי מספרי זהות ישראליים?

לא מומלץ להסתמך עליו לזה. המודל אומן על שמונה שפות זרות ומזהה מספרי זהות בתבניות בינלאומיות. בלי בדיקה והתאמה לפורמט הישראלי, הוא עלול לפספס תעודות זהות מקומיות.

האם צריך כרטיס מסך כדי להשתמש בו בייצור?

לא חובה. המודל שוקל 1.3 גיגה בייט בלבד ומסוגל לרוץ ביעילות גם על מעבד רגיל, במיוחד אם קצב הפניות סביר והטקסטים אינם באורך מקסימלי בכל קריאה.

איך מריצים

המודל שוקל 1.3 גיגה בייט בלבד, ולכן אפשר להריץ אותו בקלות על מעבד רגיל של שרת או על כרטיס מסך בסיסי עם מעט זיכרון. הטעינה נעשית דרך ספריית transformers הרגילה, אך היא מחייבת הרצת קוד מרוחק עם trust_remote_code והורדה של קובצי פענוח ייעודיים מהמאגר כדי לחלץ את המקטעים.

במשקל כזה אין שום סיבה להשתמש ב־API חיצוני. אתם מריצים אותו מקומית בתוך הרשת שלכם, מה שחיוני כשמטפלים במידע פרטי שלא אמור לצאת לענן של צד שלישי.

from transformers import pipeline

pipe = pipeline("token-classification", model="LiquidAI/LFM2.5-Encoder-350M-PII-Detector")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other, כלומר תנאי שימוש ייעודיים ולא רישיון קוד פתוח סטנדרטי כמו Apache או MIT. לפני שילוב שלו במוצר מסחרי צריך לקרוא היטב את תנאי השימוש שהחברה מצרפת ולוודא שהם לא מגבילים הפצה מסחרית.

הרישיון המלא בעמוד המודל ↗