GPT
N

ner-english

קוד פתוח

flairרישיון לא דווח2022-03-02

  • flair
  • pytorch
  • token-classification
  • sequence-tagger-model
  • en

יש כאן גם סקירה על flair עצמו.

זיהוי ישויות בסיסי באנגלית שלא דורש מודל ענק או חומרה כבדה. הוא שוקל 400 מגה בייט ומתאים למי שצריך תיוג מהיר ומקומי של שמות, מקומות וארגונים.

  • 400 MBמשקל הקבצים
  • 141,246הורדות בחודש
  • 36לייקים

מה זה

מדובר במודל הסטנדרטי של ספריית Flair לחילוץ ישויות באנגלית מתוך טקסט. הוא מתמקד בארבע קטגוריות בלבד: שמות של אנשים, מיקומים גיאוגרפיים, ארגונים, ושונות. הארכיטקטורה שלו נשענת על שילוב של שיכוך תווים עם LSTM ורשת CRF, מבנה קלאסי ושונה לחלוטין ממודלי השפה הגדולים שמבוססים על טרנספורמרים.

במבחן CoNLL-03 המודל מציג ציון F1 של 93.06. המספר הזה מעיד על דיוק גבוה מאוד בזיהוי גבולות הישות ובשיוך שלה לקטגוריה הנכונה, אבל צריך לזכור שמדובר במבחן על סגנון כתיבה חדשותי ומוגדר היטב. אם הטקסט שלכם דומה לפורמט הזה, התיוג יהיה אמין וכמעט לא ידרוש תיקונים ידניים.

מתאים ל

  • סינון שמות ומיקומים

    שליפת אנשים וערים מתוך מסמכים באנגלית במהירות ובלי צורך להרים שרתי GPU כבדים.

  • אנונימיזציה של מידע

    איתור שמות של עובדים או לקוחות בטקסט חופשי כדי למחוק אותם לפני שמירה או ניתוח.

  • קטלוג מסמכים וכתבות

    תיוג ארגונים המוזכרים בטקסט כדי לבנות חיפוש וסינון אוטומטי לפי חברות.

איפה זה נופל

המודל עובד באנגלית בלבד, וטקסט בעברית פשוט לא יעבור בו. מעבר לזה, הוא מוגבל לארבע התוויות הקבועות שלו, כך שאם אתם מחפשים תאריכים, סכומי כסף או מושגים טכניים, הוא יתעלם מהם או ידחוף אותם לקטגוריית השונות. הביצועים גם עלולים לצנוח בטקסטים לא רשמיים, כמו שיחות צ'אט או כתיבה עם שגיאות הקלדה שלא דומות למאגרי המידע שעליהם הוא אומן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית?

לא. המודל אומן על אנגלית בלבד ולא מזהה ישויות בשפות אחרות. אם תזינו לו עברית, הוא פשוט לא ימצא כלום או יחזיר פלט שגוי לחלוטין.

האם אני חייב כרטיס מסך כדי לקבל זמני תגובה סבירים?

ממש לא. מדובר במודל של 400 מגה בייט שמבוסס על LSTM ולא על ארכיטקטורת ענק. מעבד מודרני ממוצע יכול לנתח משפטים תוך עשרות מילישניות בודדות ללא חומרה מיוחדת.

איך מריצים

כדי להריץ אותו מתקינים את ספריית flair וטוענים את SequenceTagger עם השם של המודל ישירות בפייתון. הקבצים שוקלים 400 מגה בייט, כך שאין שום צורך בכרטיס מסך ייעודי. מעבד רגיל יספיק פה לגמרי, והוא יעבוד בלי בעיה גם על שרת וירטואלי קטן או במחשב הנייד שלכם.

אין סיבה לשלם על API חיצוני כשמדובר במשימה מוגדרת כזו. קריאה לשירות ענן תהיה איטית ויקרה יותר בהשוואה להרצה מקומית של כמה שורות קוד, אלא אם אין לכם שרת ואתם מריצים רק שאילתות בודדות פעם ביום.

pip install -U huggingface_hub
hf download flair/ner-english

הקבצים

6 קבצים במאגר, 400 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בעמוד המודל לא דווח רישיון כלל. המשמעות ברורה: מבחינה משפטית אין לכם אישור רשמי לשלב אותו במוצר מסחרי, ושימוש כזה חושף אתכם לסיכון של הפרת זכויות יוצרים עד שהיוצרים יעדכנו תנאי שימוש ברורים.

הרישיון המלא בעמוד המודל ↗