GPT
P

piiranha-v1-detect-personal-information

קוד פתוח

iiiorgcc-by-nc-nd-4.02024-09-12

  • transformers
  • safetensors
  • deberta-v2
  • token-classification
  • generated_from_trainer

זיהוי מידע מזהה בטקסטים בשש שפות אירופיות על בסיס מודל קטן ומהיר. הוא מתאים למי שחייב לנקות שמות, מיילים וסיסמאות מקומי בלי לשלוח מידע החוצה.

  • 278Mפרמטרים
  • 512טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 284,647הורדות בחודש

מה זה

מדובר בהתאמה של mdeberta-v3-base למשימת סיווג טוקנים עבור 17 סוגי מידע אישי, מאשראי ותעודות זהות ועד שמות וכתובות. הוא עובד באנגלית, ספרדית, צרפתית, גרמנית, איטלקית והולנדית, אבל לא בעברית.

המספרים בדף מציגים דיוק בינארי של מעל 98 אחוז באיתור טוקנים רגישים, אבל כשצוללים לחלוקה לקטגוריות הדיוק יורד לאזור 93 אחוז. בפועל זה אומר שהוא מזהה מצוין שמשהו הוא מידע פרטי, למשל אימיילים שנתפסים בדיוק מושלם של 100 אחוז או טלפונים עם ריקול מלא, אבל לעיתים קרובות הוא מתבלבל בין שם פרטי לשם משפחה. אם המטרה היא השחרת טקסט גורפת, הטעויות האלה לא באמת מפריעות.

מתאים ל

  • הסרת פרטים ממאגרי הדרכה

    השחרה אוטומטית של מיילים, שמות וטלפונים באנגלית או צרפתית לפני אימון מודלים פנימיים.

  • ניקוי לוגים ומסדי בדיקות

    זיהוי סיסמאות, כתובות IP ופרטי אשראי שנשפכו בטעות לקבצי טקסט כדי לעמוד בתקני פרטיות.

  • אנונימיזציה למחקר אקדמי

    סינון שמות ותעודות זהות מתוך תמלילי שיחות או טקסטים אירופיים לשימוש במחקר שאינו מסחרי.

איפה זה נופל

חלון ההקשר קצר מאוד ועומד על 256 טוקנים של דברטה לפי הכרטיס, למרות ההגדרה הטכנית של 512, כך שחובה לפצל טקסטים ארוכים ידנית לפני העיבוד. בנוסף, הריקול של שמות משפחה עומד על 0.78 בלבד, מה שאומר שיותר מחמישית משמות המשפחה עלולים להתפספס ולהישאר בטקסט. המפתחים עצמם מבהירים שהשימוש הוא על אחריותכם ואין שום התחייבות שהמידע אכן יימחק.

שאלות
נפוצות

האם הוא תומך בזיהוי שמות או כתובות בעברית?

לא. המודל אומן ונבדק על שש שפות אירופיות בלבד, ולא נבדק על שפות שמיות. אם תזינו טקסט בעברית, הוא יפספס כמעט בוודאות את רוב הישויות הרגישות ולא הייתי מסתמך עליו למטרה הזו.

אם הרישיון לא מסחרי, מותר לי להריץ אותו בחברה כדי לנקות דאטה פנימי?

לא בטוח בכלל. שימוש בתוך סביבה עסקית נחשב בדרך כלל מסחרי תחת NC, ורוב עורכי הדין ימליצו לחברות לא לגעת ברישיון הזה. עדיף למצוא מודל ברישיון אפאצ'י או MIT אם הדאטה שייך לעסק.

איך מריצים

עם משקל של כ־1.1 גיגה בייט וקצת פחות מ־280 מיליון פרמטרים, אפשר להריץ אותו בלי בעיה על מחשב מקומי עם כרטיס מסך בסיסי או ישירות על המעבד דרך transformers. אין פה גרסאות שונות לבחור ביניהן, מקבלים את קובץ המקור בפורמט float32.

המשמעות של מודל ייעודי קטן כזה היא מהירות ועלות אפסית בהשוואה לקריאות API למודלי שפה ענקיים. אם אתם צריכים לנקות כמויות גדולות של פניות תמיכה או לוגים, הרצה מקומית של כמה אלפי טוקנים בשנייה זולה פי כמה משימוש בענן חיצוני.

from transformers import pipeline

pipe = pipeline("token-classification", model="iiiorg/piiranha-v1-detect-personal-information")
print(pipe("שלום"))

הרישיון

רישיון cc-by-nc-nd-4.0 אוסר שימוש מסחרי מכל סוג ומגביל גם הפצה של שינויים או גרסאות נגזרות. אם אתם בונים מוצר רווחי, אתם לא יכולים להטמיע אותו בשרתים שלכם. הוא מתאים רק למחקר, בדיקות פנימיות או פרויקטים אישיים ללא כוונת רווח.

הרישיון המלא בעמוד המודל ↗