GPT
R

rampart

קוד פתוח

nationaldesignstudiocc-by-4.02026-06-28

  • transformers.js
  • onnx
  • bert
  • token-classification
  • pii

מודל קומפקטי לזיהוי והסתרת פרטי זיהוי אישי ישירות במכשיר המשתמש. הוא מיועד למי שרוצה למנוע זליגת מידע רגיש לשירותי ענן בלי לסמוך על שרתים מרוחקים.

  • 512טוקנים בהקשר
  • 14.7 MBמשקל הקבצים
  • 7,028הורדות בחודש
  • 163לייקים

מה זה

מדובר במודל סיווג טוקנים שמבוסס על גרסה מכווצת של MiniLM עם 6 שכבות ו־18.5 מיליון פרמטרים, שעבר קוונטיזציה ל־4 ביט. תפקידו לסמן 17 סוגי ישויות של מידע מזהה בטקסט, כמו שמות פרטיים, טלפונים ומספרי מסמכים, לפני שהתוכן נשלח הלאה.

הוא שונה ממודלים כבדים בכך שהוא מתוכנן לעבוד יחד עם שכבה דטרמיניסטית של ביטויים רגולריים. השכבה החיצונית סוגרת תבניות מוגדרות עם בדיקות תקינות כמו כרטיסי אשראי או תעודות זהות אמריקאיות, והמודל משלים את הטקסט החופשי והשמות.

בבדיקות על 30,000 שורות במבחן פתוח על שבע שפות לטיניות, המערכת השיגה 98.42% שחזור של מונחים פרטיים. בפועל, המשמעות היא שמונח אחד מכל 64 מונחים רגישים עדיין חומק מהמערכת ומגיע לשירות היעד, כך שהוא לא מספק הגנה מוחלטת בפני עצמו.

מתאים ל

  • הסתרת מידע לפני מודל שפה

    מחיקת שמות, טלפונים וכתובות מהטקסט של המשתמש בצד הלקוח לפני שהוא נשלח לעיבוד ב־LLM חיצוני.

  • טיהור לוגים ודוחות קריסה

    סינון אוטומטי של פרטים אישיים משגיאות ומעקבי מערכת כדי למנוע שמירת מידע רגיש בשרתי ניטור.

  • בדיקת טפסים באנגלית בדפדפן

    זיהוי והחלפת שדות אישיים רגישים בטקסט חופשי עבור מערכות שירות באנגלית ובשפות אירופיות.

איפה זה נופל

החיסרון הבולט הוא היעדר תמיכה בשפות שאינן מבוססות על האלפבית הלטיני. עברית, ערבית, רוסית או שפות מזרח אסיה לא נתמכות, ובשמות בשפות אלו השחזור צונח לכ־14 אחוזים בלבד. אם המשתמשים שלכם מקלידים עברית, הוא פשוט לא רלוונטי כרגע.

בנוסף, הוא לא מזהה פרטים שמסגירים זהות בעקיפין, כמו שילוב של מחלה נדירה ועיר קטנה, והוא לא עמיד בפני התקפות זדוניות שמשבשות אותיות כדי לעקוף סינון. במבחני שמות מגוונים מסורות שונות, רמת השחזור צנחה ל־65.44 אחוזים.

שאלות
נפוצות

האם אפשר להשתמש בו כדי לסנן מידע אישי בעברית?

לא. המודל אומן אך ורק על שבע שפות באלפבית לטיני: אנגלית, ספרדית, צרפתית, גרמנית, איטלקית, פורטוגזית והולנדית. על שפות בכתב אחר, כולל עברית, הוא מפספס את רוב המידע ולא מתאים לשימוש.

האם המודל לבדו מספיק כדי לחסום מספרי כרטיסי אשראי?

לא מומלץ להסתמך עליו לבד. המערכת המלאה משתמשת בו לצד שכבת ביטויים רגולריים שבודקת תקינות ספרות במבנה Luhn. המודל מתמחה בטקסט פתוח, בעוד מספרים מובנים נתפסים טוב יותר בשכבה הדטרמיניסטית.

איך מריצים

מריצים אותו ישירות בדפדפן או ב־Node.js באמצעות הספרייה transformers.js ומנוע ONNX Runtime. המשקל הזעיר שלו, 14.7 מגה־בייט בלבד, מאפשר לו לרוץ בקלות על חומרת מעבד פשוטה או על גבי WebGPU ו־WASM, בלי שום צורך בכרטיס מסך ייעודי.

זמני הריצה נמוכים מאוד: חציון של 6.6 מילי־שניות על מעבד ב־Node.js, ו־3.9 מילי־שניות עם WebGPU. אם אתם בונים ממשק לקוח ומעוניינים לבצע אנונימיזציה עוד לפני שהמידע יוצא לרשת, הרצה מקומית כזו עדיפה על קריאת API שתחשוף את המידע ותוסיף השהיה מיותרת.

pip install -U huggingface_hub
hf download nationaldesignstudio/rampart

הרישיון

הרישיון הוא CC BY 4.0. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במוצר שלכם, בתנאי שנותנים קרדיט מתאים ליוצרים המקוריים ומציינים אם נעשו שינויים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗