GPT
P

privacy-filter

קוד פתוח

openaiapache-2.02026-04-17

  • transformers
  • onnx
  • safetensors
  • openai_privacy_filter
  • token-classification

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

זה מודל לזיהוי והסתרת מידע אישי וסודות שרץ במעבר יחיד על הטקסט. הוא מתאים למי שחייב להריץ ניקוי מידע מקומית בלי לשלוח נתונים החוצה.

  • 1.4Bפרמטרים
  • 131,072טוקנים בהקשר
  • 16.2 GBמשקל הקבצים
  • 300,223הורדות בחודש

מה זה

במקום לחכות למודל גנרטיבי שפולט טוקנים לאט, המודל הזה מתפקד כמסווג טוקנים דו כיווני. הוא סורק את הקלט ומצמיד לכל מילה תווית מתוך שמונה קטגוריות פרטיות, כולל שמות, כתובות, טלפונים, תאריכים ומפתחות גישה. הבסיס שלו נשען על ארכיטקטורת תערובת מומחים עם מאה עשרים ושמונה מומחים בסך הכול, כשבפועל רק ארבעה מופעלים עבור כל טוקן, מה שמביא אותו לכחמישים מיליון פרמטרים פעילים בלבד בזמן חישוב.

השילוב של תשומת לב מקומית ברוחב מאה עשרים ושמונה טוקנים עם פענוח ויטרבי מבטיח שהזיהוי לא יחתוך חצאי שמות או ישבור רצפים של כתובת אימייל. במקום לקבל החלטה נפרדת ומנותקת על כל מילה, האלגוריתם בוחן את המסלול ההגיוני של הרצף כולו כדי לשמור על גבולות ביטוי עקביים.

מתאים ל

  • ניקוי קבצי לוג ומאגרים

    זיהוי כתובות אימייל, טלפונים ומפתחות שדלפו לטקסט ארוך לפני שמירת המידע או שיתופו.

  • סינון קלט בדפדפן המשתמש

    הסרת פרטים מזהים ישירות בצד לקוח דרך WebGPU לפני שהבקשה עוזבת את המכשיר.

  • בקרת פרטיות ברישיונות קוד

    סריקה מהירה של מסמכים וטקסטים לאיתור סודות ומספרי חשבונות במעבר יחיד.

איפה זה נופל

האימון התמקד בעיקר באנגלית. מפתחי המודל מזהירים במפורש מביצועים ירודים בטקסטים שאינם באנגלית, באלפבית שאינו לטיני, ובשמות שמקורם באזורים או תרבויות שלא יוצגו מספיק באימון. בעברית סביר מאוד שתיתקלו בפספוסים של שמות ישראליים או בזיהוי מקוטע, ולכן אסור להסתמך עליו כמנגנון אנונימיזציה מוחלט בלי כיול והתאמה.

בעיה נוספת היא מדיניות התוויות הקבועה. המודל לא תומך בשינוי הגדרות בזמן ריצה, ומפספס בקלות פורמטים חדשים של מפתחות סודיים או מספרי מזהה מקומיים, לצד מחיקת יתר של מחרוזות אקראיות תמימות כמו גיבובים.

שאלות
נפוצות

האם המודל יצליח להסתיר שמות ופרטים בעברית?

הוא אומן בעיקר על אנגלית ומפתחי המודל מציינים בפירוש שחלוקת הנתונים שלו לא מכסה היטב שפות באלפבית שאינו לטיני. על טקסט בעברית צפויים פספוסים רבים בזיהוי שמות מקומיים ותבניות ישראליות, כך שמומלץ לבצע אימון התאמה ייעודי לפני שימוש כזה.

איך אפשר לשלוט על רמת הרגישות כדי לא למחוק מילים מיותרות?

המודל מאפשר לכוונן בזמן ריצה את הפרמטרים של אלגוריתם הפענוח. על ידי שינוי משקלי המעבר תוכלו לבחור בין כיסוי רחב שמסיר כל ספק לבין העדפת דיוק שמשאירה מילים גבוליות בטקסט.

איך מריצים

משקל הקבצים עומד על 16.2 גיגה בייט, כך שצריך לפנות מקום בכונן, אבל בזמן ריצה דרישות החומרה נמוכות מאוד. המודל פועל ישירות מתוך ספריית transformers בפייתון, ונתמך גם בדפדפן דרך transformers.js עם האצת WebGPU וכימות ל־q4, כך שהוא מתאים ללפטופים ולמחשבי קצה רגילים בלי שרת ייעודי.

אם יש לכם שרת מקומי קיים, שווה להרים אותו לבד כי תחסכו השהיה ועלויות תעבורה, לצד שמירה מוחלטת של המידע אצלכם. קריאה ל־API חיצוני כדאית בעיקר כשמדובר בכמויות זניחות שלא מצדיקות שמירת 16 גיגה בדיסק והחזקת סביבת עבודה עצמאית.

from transformers import pipeline

pipe = pipeline("token-classification", model="openai/privacy-filter")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו מחדש ולהפיץ אותו כחלק ממוצר סגור או פנימי, כל עוד מצרפים עותק של הרישיון וציון זכויות היוצרים המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗