GPT
T

tanaos-text-anonymizer-v1

קוד פתוח

tanaosmit2025-11-27

  • transformers
  • safetensors
  • roberta
  • token-classification
  • text-anonymization

מודל קטן להסתרת פרטים מזהים באנגלית, שמחליף שמות, כתובות וטלפונים בתיוג מוסתר. הוא מתאים למי שחייב לנקות טקסטים מקומית בלי לשלוח מידע רגיש לשום ענן.

  • 124Mפרמטרים
  • 514טוקנים בהקשר
  • 478 MBמשקל הקבצים
  • 100הורדות בחודש

מה זה

מדובר במודל סיווג טוקנים שמבוסס על RoBERTa ואומן על דאטה סינתטי של עשרת אלפים פסקאות. במקום לנסות לזהות עשרות סוגי ישויות, הוא מתמקד בחמש קטגוריות בסיסיות של פרטי זיהוי אישיים: שמות, מיקומים גיאוגרפיים, תאריכים, כתובות מלאות ומספרי טלפון.

הוא מיועד לתפוס את המידע הרגיש בטקסט ולהחליף אותו בתגית ייעודית לפני שמעבירים את המידע הלאה או שומרים אותו. כרטיס המודל לא מציג ציוני דיוק או מדדי ביצועים רשמיים, כך שאין דרך לדעת מה אחוז הפספוסים שלו בלי לבדוק אותו ישירות על הנתונים שלכם.

מתאים ל

  • ניקוי יומני שרת באנגלית

    הסרת שמות, כתובות ומספרי טלפון מקובצי לוג לפני שמייצאים אותם למערכות ניטור חיצוניות.

  • טשטוש פניות תמיכה

    הסרת פרטים מזהים מטיקטים של לקוחות באנגלית לפני העברתם למאגרי מחקר או אימון פנימיים.

  • הכנת דאטה ל־LLM

    סינון מקומי ומהיר של שמות ומיקומים מתוך טקסטים גולמיים כדי לשמור על עמידה בכללי פרטיות.

איפה זה נופל

המודל אומן על אנגלית בלבד ומבוסס כולו על דאטה סינתטי כללי, כך שכל טקסט בעברית או ניסוחים מקצועיים מתחום הרפואה והמשפט עלולים לגרום לו לפספס. בנוסף, חמש הקטגוריות שלו מוגבלות מאוד. אין כאן תמיכה במספרי תעודות זהות, כתובות אימייל, מספרי חשבון בנק או כרטיסי אשראי, שזה בדיוק מה שדורשות תקנות פרטיות מחמירות. חלון ההקשר מוגבל ל־514 טוקנים, מה שמחייב אתכם לחתוך טקסטים ארוכים למקטעים לפני העיבוד.

שאלות
נפוצות

האם המודל מזהה פרטים מזהים בעברית?

לא. המודל מבוסס על ארכיטקטורת RoBERTa באנגלית ואומן על דאטה סינתטי באנגלית בלבד. הוא לא יזהה ישויות בעברית ולא יתאים לטקסטים מקומיים.

האם הוא מוחק גם כתובות מייל ומספרי אשראי?

לא, הוא הוגדר ואומן ספציפית לחמש קטגוריות בלבד: אנשים, מיקומים, תאריכים, כתובות וטלפונים. לכל פרט מזהה אחר תצטרכו להוסיף ביטויים רגולריים או מודל נוסף.

איך מריצים

עם 124 מיליון פרמטרים ומשקל של פחות מחצי ג'יגה, אפשר להריץ אותו בקלות על כל מעבד מודרני בלי לחשוב בכלל על כרטיס מסך ייעודי. מריצים אותו ישירות עם ספריית transformers בפייתון או דרך חבילת artifex שדרכה הוא נוצר.

אם אתם צריכים לנקות כמויות גדולות של מסמכים בתוך הרשת המקומית, שווה להרים אותו לבד בעלות חומרה אפסית. שירותי ענן חיצוניים עדיפים רק אם אתם חייבים לזהות מגוון רחב בהרבה של מזהים כמו תעודות זהות או כרטיסי אשראי, שלא קיימים כאן.

from transformers import pipeline

pipe = pipeline("token-classification", model="tanaos/tanaos-text-anonymizer-v1")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר שמותר לעשות איתו כמעט הכל, כולל שימוש מסחרי, שינוי הקוד ושילוב שלו במוצר סגור. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗