GPT
P

privacy-filter-nemotron-v2

קוד פתוח

OpenMedother2026-05-03

  • transformers
  • safetensors
  • openai_privacy_filter
  • token-classification
  • privacy

מודל סיווג לזיהוי והסתרת מידע מזהה שמקטלג 55 סוגי פרטיות שונים. הוא מיועד למי שצריך אנונימיזציה מדויקת ברמת הטוקן על טקסטים ארוכים.

  • 1.4Bפרמטרים
  • 131,072טוקנים בהקשר
  • 2.6 GBמשקל הקבצים
  • 27,125הורדות בחודש

מה זה

מדובר במודל סיווג טוקנים שמבוסס על הארכיטקטורה של openai/privacy-filter, עם 1.4 מיליארד פרמטרים ומבנה תערובת מומחים שמפעיל רק כחמישים מיליון פרמטרים לכל טוקן. המטרה העיקרית של גרסה שתיים היא לתפוס יותר מופעים של מידע רגיש בלי לפספס, באמצעות אימון על דאטה סינתטי רחב יותר מזה של הגרסה הקודמת.

הוא מסווג 221 מחלקות בפורמט BIOES ומכסה קשת רחבה של 55 קטגוריות, החל משמות, תאריכי לידה וכתובות, ועד מזהים רפואיים, מספרי כרטיסי אשראי, מפתחות API וכתובות רשת. היכולת הזו מאפשרת להחליף מזהים ספציפיים בתגיות מדויקות ולא סתם למחוק טקסט בצורה עיוורת.

מתאים ל

  • הסרת פרטים מתיעוד רפואי

    זיהוי מספרי תיק רפואי, שמות ופרטי קשר באנגלית מתוך סיכומי מטופלים לפני ניתוח מחקרי.

  • טיהור יומני שרתים וקוד

    איתור מפתחות API, כתובות IP וסיסמאות בטקסט חופשי לפני שמירת לוגים במאגרים משותפים.

  • סינון מידע פיננסי

    מחיקת מספרי כרטיסי אשראי, קודי גישה ומספרי חשבון מתוך תכתובות לקוחות בארגון.

איפה זה נופל

המודל אומן על מידע סינתטי באנגלית ובשפות אירופיות מסוימות, ועברית אינה מופיעה ברשימת השפות הנתמכות שלו. אם תזינו לו טקסט מקומי עם מספרי תעודת זהות ישראליים או כתובות בעברית, הוא יפספס אותם.

בנוסף, הכרטיס מוגדר כניסיוני ומבהיר במפורש שאסור להסתמך עליו לבדו במערכות קריטיות כמו רפואה או משפט. הוא דורש חיבור לחוקים דטרמיניסטיים, ניקוי רגולרי ובקרה אנושית, ומחייב בדיקה של התאמת הטקסטים שלכם למבנה הנתונים לפני עלייה לסביבה חיה.

אותה משפחה

privacy-filter-nemotron יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יזהה פרטי זיהוי בעברית?

הוא אינו כולל תמיכה מוצהרת בעברית, אלא בעיקר באנגלית ומספר שפות אירופיות. מזהים שכתובים בעברית ייפלטו ללא סיווג, ולכן הוא לא מתאים לעיבוד טקסט עברי ללא אימון נוסף.

איך מחברים אותו לקוד קיים?

טוענים אותו ישירות בעזרת transformers עם צינור token-classification ופרמטר trust_remote_code=True. לקבלת תוצאות מדויקות יותר, מומלץ להשתמש בספריית openmed הייעודית שמטפלת באיחוד תוויות עוקבות.

איך מריצים

בזכות משקל כולל של 2.6 גיגה בייט וארכיטקטורת מומחים קלה פר טוקן, אפשר להריץ אותו בקלות על מעבד גרפי צנוע עם כמה גיגה בייט בודדים של זיכרון, או ישירות על שרת הסקה מקומי עם מעבד חזק. ההרצה מתבצעת דרך ספריית openmed הייעודית, דרך כלי הטרמינל opf של OpenAI, או ישירות דרך ספריית transformers הרגילה בעזרת צינור סיווג טוקנים.

אין סיבה לשלם ל־API חיצוני כשהמשקל כה נמוך והרגישות של המידע המועבר כה גבוהה. כל הרעיון כאן הוא לעבד טקסטים רפואיים, פיננסיים או משפטיים מקומית בתוך הרשת המאובטחת שלכם בלי להוציא החוצה מידע שממילא מנסים להסתיר.

from transformers import pipeline

pipe = pipeline("token-classification", model="OpenMed/privacy-filter-nemotron-v2")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 2.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מדווח תחת other וללא פירוט ברור של תנאי השימוש החופשיים או המסחריים בכרטיס המודל. המשמעות היא שחובה לבדוק את תנאי הקוד של ארכיטקטורת המקור של OpenAI והסכמי הדאטה הסינתטי לפני שמשלבים אותו במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗