GPT
N

ner-english-ontonotes-large

קוד פתוח

flairרישיון לא דווח2022-03-02

  • flair
  • pytorch
  • token-classification
  • sequence-tagger-model
  • en

יש כאן גם סקירה על flair עצמו.

זיהוי ישויות באנגלית שמכסה 18 קטגוריות שונות במקום הארבע הרגילות. הוא מתאים למי שחייב לתפוס חוקים, יצירות אמנות וכספים ברמת דיוק גבוהה של מודל כבד.

  • 2.1 GBמשקל הקבצים
  • 102,354הורדות בחודש
  • 101לייקים

מה זה

רוב מודלי ה־NER הסטנדרטיים מסתפקים בארבע תגיות בסיסיות כמו אנשים ומיקומים. המודל הזה מתבסס על OntoNotes ומזהה 18 סוגי ישויות שונים באנגלית, כולל שמות חוקים, יצירות, שפות, אירועים וסכומי כסף. הבסיס שלו משלב ייצוגי XLM-R ברמת מסמך עם גישת FLERT, שנועדה לנצל הקשר רחב יותר סביב הטקסט הנבדק.

ציון ה־F1 שלו עומד על 90.93 על מערך הנתונים של OntoNotes. בפועל זה אומר שרמת הדיוק והכיסוי שלו עקבית מאוד על פני מגוון הקטגוריות, אבל מדובר במשקל כבד שמכוון לביצועים ולא למהירות שיא.

מתאים ל

  • ניתוח מסמכים משפטיים

    זיהוי תגיות של חוקים (LAW) וגופים פוליטיים באנגלית מתוך חוזים ותיקים.

  • חילוץ נתונים פיננסיים

    שליפת כמויות, אחוזים וערכי כסף (MONEY) מתוך דוחות כספיים באנגלית.

  • מיפוי תוכן ומדיה

    חילוץ שמות יצירות אמנות, אירועים ושפות מתוך מאמרים וטקסטים עיתונאיים.

איפה זה נופל

המודל אומן ותומך באנגלית בלבד. אם תזינו לו טקסט בעברית או טקסט מעורב, הוא לא יידע מה לעשות איתו ולא יזהה ישויות מקומיות. נקודה נוספת היא המשקל, 2.1 גיגה בייט הופכים אותו לכבד ומסורבל מאוד לתרחישי זמן אמת עם זמני תגובה של מילישניות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסט בעברית?

לא. המודל מאומן לזהות ישויות אך ורק בשפה האנגלית, גם אם רכיב הקידוד המקורי תומך בריבוי שפות.

האם הוא מתאים לריצה בתוך אפליקציית מובייל או דפדפן?

הקבצים שוקלים מעל שני גיגה בייט ודורשים את ספריית flair, כך שהוא מיועד לשרתים חזקים ולא למכשירי קצה.

איך מריצים

טוענים אותו ישירות דרך ספריית flair בפייתון באמצעות SequenceTagger ויוצרים אובייקט Sentence לטקסט שרוצים לתייג. קבצי המודל שוקלים 2.1 גיגה בייט, כך שצריך כרטיס מסך סביר עם מספיק זיכרון וידאו כדי לעבד כמויות טקסט בלי לזחול.

אם אתם רצים על מעבד בלבד, פעולת ההסקה תהיה אטית בהרבה בגלל גודל השכבות של XLM-R. במקרים שבהם אין לכם שרת ייעודי עם מעבד גרפי או שמדובר בבדיקה נקודתית, קריאה לשרת מרוחק עדיפה על פני תחזוקה עצמית של מודל כזה.

pip install -U huggingface_hub
hf download flair/ner-english-ontonotes-large

הקבצים

5 קבצים במאגר, 2.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא ציינו רישיון שימוש בעמוד המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם היתר מפורש להשתמש בו במוצר מסחרי, וזה סיכון שצריך לבדוק ישירות מול המפתחים של פרויקט flair בגיטהאב לפני שמשלבים אותו בקוד של החברה.

הרישיון המלא בעמוד המודל ↗