GPT
P

privacy-filter-nemotron

קוד פתוח

OpenMedapache-2.02026-04-24

  • transformers
  • safetensors
  • openai_privacy_filter
  • token-classification
  • pii

זה מודל סיווג טוקנים של 1.4 מיליארד פרמטרים שמזהה 55 סוגי מידע מזהה באנגלית. בוחרים בו כשצריך חלוקה מפורטת כמו מספרי רישום רפואי או מפתחות API, במקום קטגוריות כלליות בלבד.

  • 1.4Bפרמטרים
  • 131,072טוקנים בהקשר
  • 2.6 GBמשקל הקבצים
  • 35,049הורדות בחודש

מה זה

הבסיס מגיע מהמודל של OpenAI לסינון פרטיות, אבל במקום להסתפק בשמונה קטגוריות רחבות, הוא אומן על מאגר Nemotron של אנבידיה עם 100 אלף דוגמאות. הארכיטקטורה מבוססת תערובת מומחים, כך שלמרות הגודל הכולל, רק 50 מיליון פרמטרים פעילים בכל טוקן. חלון ההקשר עומד על 131,072 טוקנים, מה שמאפשר לעבד מסמכים ארוכים בבת אחת בלי לחתוך פסקאות.

במבחן על עשרת אלפים דוגמאות, המודל השיג ציון מאקרו B-F1 של 0.9533 ודיוק טוקנים של 0.9910. מזהים טכניים ומוחלטים כמו כתובות רשת, מספרי כרטיסי אשראי ומזהים ביומטריים מגיעים לדיוק כמעט מושלם מעל 0.99, בעוד קטגוריות מופשטות יותר דורשות תשומת לב.

מתאים ל

  • אנונימיזציה של מסמכים

    הסרת שמות, כתובות ומספרי זהות ממסמכים ארוכים באנגלית לפני שמזינים אותם למודלי שפה.

  • אבטחת יומני רישום

    זיהוי וצנזורה של מפתחות API, סיסמאות וכתובות IP מתוך לוגים של מערכות שרתים.

  • עיבוד רשומות רפואיות

    איתור מספרי תיק רפואי ותאריכי לידה בדיוק שמגיע ליותר מ־0.99 במדד F1.

איפה זה נופל

הנתונים אומנו על טקסטים באנגלית בלבד בחלוקה לארצות הברית ושאר העולם, כך שלעברית אין כאן תמיכה מובטחת והוא לא מתאים למסמכים מקומיים. בנוסף, הנתונים של Nemotron הם סינתטיים, ולכן טקסטים קליניים או משפטיים מהעולם האמיתי יכולים להיראות אחרת לגמרי.

יש גם ירידה מורגשת בדיוק בקטגוריות מורכבות: בעוד שמספר טלפון מגיע ל־0.97, מקצוע צונח ל־0.727 ומגדר ל־0.841, מה שדורש בדיקה קפדנית אם אתם מסתמכים על שדות כאלה.

אותה משפחה

privacy-filter-nemotron יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית?

האימון נעשה על אנגלית בלבד, ואין שום התחייבות לביצועים בשפות אחרות. עבור טקסט עברי עדיף לא להסתמך עליו, אלא אם כן תבצעו אימון המשך ייעודי על מאגר מקומי מתאים.

למה מומלץ להשתמש בפענוח ויטרבי ולא בשיטה הרגילה?

המודל עובד בתצורת BIOES כדי לתחום את תחילת הישות, אמצע הישות וסופה. פענוח מסוג argmax עלול לגרום לטעויות קלות בגבולות המילים שמוגדרות, בעוד שוויטרבי שומר על רצף תקין והגדרות חיתוך נקיות יותר.

איך מריצים

המשקל הכולל של הקבצים הוא 2.6 גיגה בייט, ועם פחות מ־1.4 מיליארד פרמטרים וארכיטקטורת מומחים קלה, אפשר להריץ אותו מקומית על כרטיס מסך בסיסי או מעבד מודרני בלי להזיע. אם אתם עובדים על מחשבי מק עם שבבי אפל סיליקון, יש גרסאות ייעודיות בספריית MLX שמספקות ריצה מהירה יותר ישירות על החומרה.

ההרצה נעשית ישירות מתוך ספריית transformers, באמצעות ה־CLI הרשמי של OpenAI או דרך החבילה של OpenMed. כדי למנוע טעויות בגבולות הטקסט, עדיף להשתמש בפענוח ויטרבי שמובנה בספריות האלה ולא ב־argmax פשוט.

from transformers import pipeline

pipe = pipeline("token-classification", model="OpenMed/privacy-filter-nemotron")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 2.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ ברישיון Apache 2.0 המקורי. הרישיון מתיר שימוש מסחרי, שינוי קוד והפצה, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗