GPT
D

deberta_finetuned_pii

קוד פתוח

lakshyakh93mit2023-10-06

  • transformers
  • pytorch
  • deberta
  • token-classification
  • en

המודל מזהה ומסווג מידע מזהה אישי בתוך טקסטים חופשיים באנגלית. הוא מתאים למי שחייב לנקות פרטי משתמשים מקומיים לפני שהטקסט מועבר הלאה.

  • 512טוקנים בהקשר
  • 1.6 GBמשקל הקבצים
  • 4,582הורדות בחודש
  • 60לייקים

מה זה

מדובר בהתאמה של DeBERTa למשימת סיווג טוקנים, שנועדה לאתר פרטי מידע אישי כמו שמות חשבון, מספרי כרטיסי אשראי, כתובות מייל, טלפונים וכתובות מגורים בתוך טקסט לא מובנה. במקום לנתח משפטים שלמים כיחידה אחת, הוא עובר מילה אחר מילה ומסמן את החלקים הרגישים לפי קטגוריות. ארכיטקטורת DeBERTa כוללת מנגנון תשומת לב מפורק, מה שבדרך כלל עוזר לה להבין הקשר ותחביר טוב יותר ממודלי BERT רגילים באותו סדר גודל.

היוצר לא שיתף נתוני ביצועים, ציוני דיוק או השוואות למודלים מתחרים בכרטיס המודל. אין כאן גרפים או מדדים רשמיים, כך שאת טיב הזיהוי תצטרכו לבדוק בפועל על הדאטה שלכם לפני שמסתמכים עליו בייצור.

מתאים ל

  • אנונימיזציה של פניות תמיכה

    זיהוי ומחיקה של שמות, טלפונים וכרטיסי אשראי לפני שמזינים פניות של לקוחות למאגר חיצוני.

  • ניקוי דאטה לאימון מודלים

    סריקת טקסטים חופשיים באנגלית וסינון פרטים אישיים כדי להגן על פרטיות לפני שלבי אימון.

  • בדיקת תוכן משתמשים

    מניעת פרסום פומבי של מספרי טלפון או כתובות בפורומים ובפלטפורמות תוכן ציבוריות.

איפה זה נופל

המודל מאומן על אנגלית בלבד ולא יזהה פרטים בעברית או במבנה ישראלי טיפוסי כמו תעודות זהות. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים, כך שאי אפשר לזרוק אליו מסמכים ארוכים בבת אחת בלי לחתוך אותם קודם לפסקאות קצרות. כרטיס המודל גם לא מציג את רשימת התגיות המלאה או מידע על הדאטה שעליו הוא אומן.

שאלות
נפוצות

האם הוא מזהה מספרי זהות ישראליים או שמות בעברית?

לא. המודל הוגדר ואומן על השפה האנגלית בלבד, והוא מכיר מבנים סטנדרטיים של כתובות ופרטים בארצות הברית. הוא לא יועיל לטקסטים בעברית.

איך מתמודדים עם מסמכים ארוכים יותר מ־512 טוקנים?

תצטרכו לפצל את הטקסט למקטעים קטנים או למשפטים לפני שמעבירים אותו למודל, ולחבר את תוצאות הזיהוי אחר כך לפי מיקום התווים המקורי.

איך מריצים

כדי להריץ אותו משתמשים בפייפליין של transformers מסוג token-classification עם אסטרטגיית aggregation מתאימה. משקל הקבצים עומד על 1.6 גיגה בייט בפורמט float32 עם 12 שכבות, מה שאומר שהוא רץ בלי בעיה גם על מעבד רגיל של שרת פשוט, בלי שום צורך בכרטיס מסך ייעודי.

אם יש לכם כמויות עצומות של טקסט בזמן אמת, כרטיס מסך בסיסי יקצר את זמני התגובה. פנייה לשירותי ענן חיצוניים עדיפה רק אם אתם לא רוצים לתחזק תשתית משלכם, אבל כאן כל הרעיון הוא לשמור את המידע הרגיש אצלכם בשרת ולא לשלוח אותו החוצה.

from transformers import pipeline

pipe = pipeline("token-classification", model="lakshyakh93/deberta_finetuned_pii")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים זמינים תחת רישיון MIT. מותר להשתמש בהם בפרויקטים מסחריים, לשנות את הקבצים ולהטמיע אותם בתוך מוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗