GPT
R

roberta-large-ner-english

קוד פתוח

Jean-Baptistemit2022-03-02

  • transformers
  • pytorch
  • tf
  • onnx
  • safetensors

פתרון ייעודי לחילוץ שמות וגופים מטקסטים באנגלית, בלי להסתמך רק על אותיות גדולות. הוא מיועד למי שמנתח צ'אטים ואימיילים וצריך דיוק גבוה בלי לערב מודלי שפה ענקיים.

  • 354Mפרמטרים
  • 514טוקנים בהקשר
  • 5.3 GBמשקל הקבצים
  • 34,878הורדות בחודש

מה זה

מדובר בהתאמה של רוברטה לארג' למשימת זיהוי ישויות באנגלית, עם 354 מיליון פרמטרים וחלון הקשר קצר של 514 טוקנים. האימון התבסס על CoNLL 2003, אבל המפתח כיוון מראש לתקלות הנפוצות בעולם האמיתי, כמו טקסט מרושל שבו שמות לא נפתחים באות גדולה. המודל מחלק את הטקסט לארבע ישויות בלבד: אנשים, ארגונים, מיקומים ושונות, כשהוא מוותר על תגיות מיקום פנימיות כדי לפשט את התוצאה.

בבדיקה מול טקסטים לא רשמיים, כמו אימיילים ושיחות צ'אט, המודל השיג ציון אף אחת של 0.89 בזיהוי אנשים ושל 0.74 בארגונים. ההשוואה למודל המקביל מבית ספייסי מראה יתרון בולט, במיוחד ביכולת לא לפספס ישויות, עם ריקול של 0.77 במיקומים מול 0.61 בלבד בספייסי. המשמעות היא פחות ישויות שנבלעות בטקסט לא ערוך.

מתאים ל

  • סינון שמות מאימיילים

    זיהוי מדויק של שמות שולחים וחתימות בתוך הודעות דואר אלקטרוני, גם כשהשמות נכתבו ברשלנות באותיות קטנות.

  • עיבוד תכתובות תמיכה

    שליפת שמות לקוחות, מיקומים וארגונים מתוך צ'אטים של מוקדי שירות כדי לתייג פניות באופן אוטומטי.

  • אנונימיזציה של מידע אישי

    מחיקת שמות אנשים וארגונים מטקסטים רגישים באנגלית לפני שמזינים אותם למערכות אחרות.

איפה זה נופל

המודל תומך באנגלית בלבד, ואינו מסוגל לעבד עברית. חלון ההקשר מוגבל ל־514 טוקנים, כך שאי אפשר לזרוק אליו מסמכים ארוכים בלי לחתוך אותם קודם לחלקים קטנים. מעבר לזה, המפתח ביטל את התיוג שמבדיל בין תחילת ישות להמשך שלה, מה שמקשה להפריד בין שני שמות צמודים. הדיוק בזיהוי ארגונים בשיחות צ'אט יורד ל־0.74, כך שישויות מורכבות עדיין מתפספסות.

שאלות
נפוצות

האם המודל מתאים לזיהוי שמות בעברית?

לא. המודל אומן על מאגרי מידע באנגלית בלבד ולא מזהה ישויות בעברית. שימוש בו על טקסט עברי יחזיר תוצאות שגויות או ריקות.

האם כדאי להעדיף אותו על פני ספייסי?

אם אתם מנתחים שיחות צ'אט, אימיילים וטקסט לא רשמי, התשובה חיובית. המדדים מראים שהוא תופס משמעותית יותר ישויות מספייסי בטקסטים שלא משתמשים באותיות גדולות.

איך מריצים

הקבצים שוקלים 5.3 גיגה בייט, כך שצריך כרטיס גרפי סביר עם לפחות 8 גיגה זיכרון כדי להריץ הסקת מסקנות מהירה. מי שמחפש להריץ אותו על מעבד בלבד ירגיש את האיטיות, במיוחד אם מדובר בנפח שיחות גדול.

אם יש לכם שרת ייעודי או עיבוד שרץ ברקע, ההרצה המקומית הגיונית ומשתלמת. אם מדובר בבדיקה נקודתית או בעומס שמשתנה בקיצוניות, עדיף להעלות אותו לשרת ענן מנוהל ולשלם לפי שעת פעילות במקום לקנות חומרה.

from transformers import pipeline

pipe = pipeline("token-classification", model="Jean-Baptiste/roberta-large-ner-english")
print(pipe("שלום"))

הרישיון

הרישיון הוא אם אי טי, מה שאומר חופש כמעט מוחלט. מותר להשתמש בו במוצרים מסחריים, לשנות אותו, למכור שירותים שרצים עליו ולהפיץ אותו, בתנאי שמשאירים את הקרדיט ואת נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗