GPT
I

Italian_NER_XXL

קוד פתוח

DeepMount00apache-2.02024-01-22

  • transformers
  • pytorch
  • safetensors
  • bert
  • token-classification

מודל ייעודי לזיהוי ישויות בטקסטים באיטלקית שמכסה כמות חריגה של 52 קטגוריות שונות. הוא מתאים למי שצריך לחלץ מידע רגיש, רפואי או משפטי ממסמכים מקומיים בלי לפתח סיווג מותאם מאפס.

  • 110Mפרמטרים
  • 512טוקנים בהקשר
  • 842 MBמשקל הקבצים
  • 24,577הורדות בחודש

מה זה

מדובר במודל מבוסס ארכיטקטורת BERT עם 12 שכבות וסיווג לפי טוקנים, שמתמקד כולו בשפה האיטלקית. במקום לעצור בישויות רגילות כמו שמות ואתרים, הוא מזהה 52 מחלקות שונות שכוללות מונחי מקרקעין איטלקיים, מספרי תעודות, סיסמאות, כתובות רשת, נתונים פיננסיים ופרטים רפואיים כמו תרופות ומינונים.

לפי כרטיס המודל, רמת הדיוק הכוללת שלו עומדת כרגע על 79 אחוז. בפועל זה אומר שאחת מכל חמש ישויות עלולה להתפספס או להיות מסווגת לא נכון, כך שאי אפשר לסמוך עליו בעיניים עצומות לתהליכים אוטומטיים לגמרי. השוני המרכזי שלו מדגמים מקבילים בגודל של 110 מיליון פרמטרים הוא רוחב היריעה של התגיות, מה שחוסך אימון של מודלים נפרדים לחוזים, רפואה ונתוני תקשורת באיטלקית.

מתאים ל

  • אנונימיזציה של מסמכים

    איתור מספרי זהות, מספרי חשבון בנק ופרטים רפואיים באיטלקית כדי למחוק אותם ממסמכים לפני שמירה.

  • ניתוח תיקים רפואיים

    חילוץ אוטומטי של שמות מחלות, תרופות, מינונים ומשך טיפול מתוך סיכומי אשפוז באיטלקית.

  • מיון נתוני נדל"ן וטאבו

    זיהוי מושגים ייחודיים למערכת המקרקעין האיטלקית כמו מספרי חלקות ודפי רישום בתוך חוזים.

איפה זה נופל

הבעיה הבולטת ביותר היא הדיוק המדווח של 79 אחוז בלבד, שזה נתון נמוך למערכות סינון מידע רגיש או עיבוד אוטומטי של תביעות. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים, כך שטקסטים משפטיים או תיקים רפואיים ארוכים יחייבו חיתוך ידני ואיחוד של התוצאות. כדאי לזכור גם שהוא אומן על איטלקית בלבד, ולכן מסמכים מעורבים בשפות נוספות יניבו שגיאות.

שאלות
נפוצות

האם המודל יזהה ישויות בטקסטים באנגלית או עברית?

לא. המודל הוגדר ואומן ספציפית עבור השפה האיטלקית, וגם חלק גדול מהישויות שהוא מזהה תפורות על הפורמט המקומי באיטליה כמו קוד פיסקלי או מספרי רישום מקרקעין. הרצה על שפות אחרות תייצר רעש וסיווגים שגויים לחלוטין.

האם אפשר לסמוך עליו למחיקת מידע מזהה לפני שמירת מסמך?

רק אם יש עין אנושית שבודקת את הפלט. בגלל דיוק מדווח של 79 אחוז, קיים סיכוי של יותר מעשרים אחוזים שפרטים אישיים יתפספסו ויזלגו למאגר, במיוחד מספרי כרטיסי אשראי, סיסמאות או מידע רפואי.

איך מריצים

בזכות משקל של 842 מגה בייט ודיוק של float32, אין שום צורך בחומרה כבדה כדי להריץ אותו. מעבד רגיל בשרת פשוט או מחשב פיתוח מקומי יתמודדו איתו בלי בעיה, ואם יש לכם כרטיס גרפי בסיסי העיבוד ירוץ מהר מאוד דרך transformers.

קריאה למודל שפה גדול דרך שירות חיצוני תהיה עדיפה בעיקר אם אתם עובדים עם פסקאות ארוכות שמחייבות הבנה של הקשר רחב, או כשצריך לנתח מסמכים שלמים ברצף בלי לחתוך אותם מראש לפי חלון הטוקנים.

from transformers import pipeline

pipe = pipeline("token-classification", model="DeepMount00/Italian_NER_XXL")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש פעולה רחב. מותר להשתמש בו במוצרים מסחריים, לשנות אותו, להריץ אותו על שרתים פנימיים ולהפיץ אותו הלאה, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗